认知科学贝叶斯数据分析导论

Introduction to Bayesian Data Analysis for Cognitive Science

https://www.researchgate.net/publication/393753745_Introduction_to_Bayesian_Data_Analysis_for_Cognitive_Science

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

认知科学贝叶斯数据分析导论

本书向认知科学(如语言学、心理语言学、心理学、计算机科学)领域的学生和研究人员介绍贝叶斯数据分析与贝叶斯认知建模,尤其关注对来自计划性实验的数据进行建模。本书依托于概率编程语言Stan以及作为Stan前端的R包brms。本书仅假设读者熟悉统计编程语言R,并具备高中基础的前微积分数学知识;书中所需的一些重要数学概念将在第一章中加以介绍。

通过本书,读者将能够培养在其自身领域内应用贝叶斯建模的实际能力。本书首先以非正式的方式介绍基础主题,如概率论,以及单变量和双变量/多变量的离散与连续随机变量。随后,通过几个无需计算软件即可完成的简单解析示例,引入贝叶斯法则在统计推断中的应用;此处的主要观点在于,参数的后验分布是先验分布与似然函数之间的一种折中。接着,本书借助R中的brms包逐步构建回归框架,最终导向分层回归建模(即线性混合模型)。在此过程中,详细讨论了先验选择及建立良好工作流程的主题。后续章节介绍Stan编程语言,并通过实际示例涵盖高级主题:对比编码、基于贝叶斯因子和交叉验证的模型比较、分层模型与重参数化、自定义分布的定义、测量误差模型与元分析,最后是若干认知模型示例:多项加工树模型、有限混合模型和累积模型。其他章节、附录及练习题以在线材料形式提供,可访问以下链接获取:https://github.com/bincenboim/bayescogSCI。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

前沿

这本书旨在作为一份相对温和的入门指南,介绍如何使用概率编程语言Stan(Carpenter 等,2017)以及Stan的前端brms(Bürkner,2024)来执行贝叶斯数据分析和认知建模。我们的目标读者是认知科学家(例如,语言学家、心理学家和计算机科学家),他们开展有计划的行为实验,并有兴趣以系统性的方式从基础开始学习贝叶斯数据分析方法。我们的目标是使贝叶斯统计学成为实验语言学、心理语言学、心理学及相关学科数据分析工具包中的一个标准组成部分。

关于贝叶斯数据分析,已经有许多优秀的入门教科书存在。为什么还要再写一本?我们的文本在其他尝试的基础上有两个不同之处。第一,我们的主要重点是展示如何分析来自涉及重复测量的计划实验的数据;这类实验数据涉及独特的复杂性。我们提供了许多数据集示例,涉及时间测量(例如,自定步速阅读、阅读时的眼动追踪、嗓音起始时间)、事件相关电位、瞳孔大小、正确率(例如,回忆任务、是非问句)、分类答案(例如,图片命名)、选择反应时(例如,斯特鲁普任务、运动检测任务)等。第二,从一开始,我们就强调一种特定的工作流程,其核心是模拟数据;我们旨在教授一种哲学,即在数据收集之前就深入思考假定的底层生成过程。我们希望通过本书传授的数据分析方法包括一个由先验预测检查和后验预测检查、敏感性分析以及使用模拟数据进行模型验证所构成的循环。我们试图培养一种意识,即如何从理论上有趣的参数的后验分布中得出推论,而无需诉诸像“显著”或“不显著”这样的二元决策。我们希望这将为以更细致的方式报告和解释数据分析结果设定一个新的标准,并导致已发表文献中出现更加审慎的论断。

为什么要读这本书,它的目标读者是谁?

在心理学、心理语言学及其他领域中,一种普遍持有的观念是,统计数据分析从属于科学,并且应当快速而简单。例如,一位资深数理心理学家曾对本书的最后一位作者说:“如果你需要运行比配对t检验更复杂的东西,那你就是在问错误的问题。”我们在此采取不同的视角:科学与统计建模是统一的一回事。统计模型应当代表对假定起作用的潜在认知过程的某种合理近似。

本书的目标读者是那些希望将统计学视为其科学工作中平等合作伙伴的学生和研究者。我们期望读者愿意花时间去理解并运行计算分析。

任何严谨的贝叶斯数据分析入门都至少需要概率论、微积分和线性代数的被动知识。然而,我们并不要求读者在开始阅读本书时就已经具备这些背景知识。相反,相关概念会在需要时以非正式的方式及时引入。我们从不要求读者具备主动解决概率问题、求解积分或计算导数,或手动执行矩阵运算(例如矩阵求逆)的能力。书中有些地方讨论会变得技术性较强,需要一定的微积分或相关主题知识。然而,不熟悉所需数学知识的读者可以跳过这些部分,因为这些部分对于理解本书的主线并非真正必要。

我们确实期望的是读者熟悉算术、基础集合论和初等概率论(例如,求和规则和乘积规则、条件概率)、简单的矩阵运算如加法和乘法,以及简单的代数运算。强烈建议在开始阅读本书之前先快速浏览一下Gill(2006)的第1章。我们还预设,当需要时,读者愿意去查证他们可能已经忘记的概念(例如,对数)。我们还提供了一个针对非数学背景人士的数学基本概念自定进度课程,读者可以学习:参见 https://vasishth.github.io/FoM/。

我们还期望读者已经掌握和/或愿意学习足够的R编程语言(R Core Team 2023)知识,以便重现所呈现的示例并完成练习。如果读者完全不熟悉R,在开始阅读本书之前,他们应该先查阅如《R for data science》(https://r4ds.had.co.nz/)和《Efficient R programming》(https://csgillespie.github.io/efficientR/)之类的书籍。熟悉Python的读者可能会发现Jozsef Arato对前五章的Python移植版本很有用(https://github.com/jozsarato/bayescogdat)。

我们还假设读者已经接触过简单线性建模和线性混合模型(Bates等,2015;Baayen, Davidson, 和 Bates,2008)。这在实践中的意思是,读者应该已经在R中使用过lm()和lmer()函数。我们也默认读者对基本统计概念(如两个变量之间的相关性)有粗略的了解。

本书不适合完全没有数据分析经验的新手。数据分析的新手应该从像Kerns(2014)这样的免费教科书开始,然后阅读我们为频率论数据分析撰写的导论,该导论也可在网上免费获取(Vasishth, Schad, 等,2021)。后一本书将为读者阅读本书内容做好充分准备。

为本书培养正确的心态

读者应带给本书的一个非常重要的特质是"我能行"的精神。书中会有很多地方进展会变得困难,读者将不得不放慢速度,动手摆弄材料,或者重新温习算术或初中代数的理解。这种"我能行"精神的基本原则在Burger和Starbird(2012)的书中得到了很好的总结;另见Levy(2021)。虽然我们无法用几句话概括这些书中的所有见解,但受Burger和Starbird(2012)一书的启发,以下简要列举读者需要培养的几种心态:

  • 花时间在基础、看似简单的材料上;确保你深入理解它。寻找自己理解中的漏洞。阅读不同来源(不同的书籍或文章)对同一材料的阐释可以带来新的见解。

  • 让错误和失误成为你的老师。我们本能地排斥自己的错误,但错误最终是我们的朋友;它们比正确答案更有潜力教会我们更多。在这个意义上,一个正确的解可能不如一个错误的解有趣。

  • 当你被某个练习或问题吓到时,立即放弃并承认失败。这会让大脑放松;你已经放弃了,没什么可做的了。然后,过一会儿,尝试解决该问题的简化版本。有时,把问题分解成更小的部分是有用的,每个部分可能更容易解决。

  • 提出你自己的问题。不要等着被提问;开发你自己的问题,然后尝试解决它们。

  • 不要期望在第一遍中理解所有内容。只需在脑海中记下理解中的漏洞,稍后再回过头来处理这些漏洞。

  • 定期退后一步,尝试勾勒出你所学内容的更大图景。在不查阅任何资料的情况下写下你所知道的内容,是实现这一目标的一种有用方法。不要等老师给你提供你应该学到什么的要点总结;自己制定这样的总结。

  • 培养查找信息的技巧。当遇到你不懂的东西或某些晦涩的错误信息时,使用谷歌寻找一些答案。

  • 不要犹豫重读某一章;通常,一个人只有重新审视材料之后才能理解某个主题。

作为教师,我们多年来注意到,具有这种心态的学生通常做得很好。有些学生已经具备了这种精神,但其他人需要有意识地培养它。我们坚信每个人都可以培养这样的心态,但可能需要努力去获得它。无论如何,对于这类书来说,这样的态度是必要的。

如何阅读本书

本书各章节旨在按顺序阅读,但在第一遍通读本书时,读者可以自由跳过可选的在线深入材料。这些资源提供了更正式的理论展开(有助于过渡到更高级的教科书,如Gelman等,2014),或涉及章节中所呈现主题的次要方面。

以下是取决于读者目标的几种建议阅读路径:

  • 对于完全初学者的短期课程,请阅读第1至第5章。我们通常在我们每年举办的为期五天的暑期学校课程中涵盖这五章。这些章节中的大部分内容也包含在一个免费的为期四周的在线课程中:https://open.hpi.de/courses/bayesian-statistics2023。

  • 对于侧重于使用R包brms进行回归模型的课程,请阅读第1至第7章,并可选择阅读第13章。

  • 对于侧重于涉及Stan的复杂模型的高级课程,请阅读第8至第18章。

关于作者

Bruno Nicenboim(https://bruno.nicenboim.me)是荷兰蒂尔堡大学认知科学与人工智能系的助理教授,担任计算心理语言学研究方向的首席研究员(PI)。他在阿根廷罗萨里奥国立大学开始学习电子工程,随后转向人文科学,并在以色列度过了八年,期间在特拉维夫大学获得了社会学和语言学学士学位以及语言学硕士学位。在此期间,他还在多家IT公司工作过。之后他移居德国,在波茨坦大学完成了认知科学博士学位,并做了两年的博士后研究员。他的研究兴趣包括贝叶斯方法、计算认知建模、句子理解、记忆过程、决策制定和预测性加工。他定期在研讨会和暑期学校教授贝叶斯数据分析短期课程,并在蒂尔堡大学的认知科学与人工智能以及数据科学与社会硕士项目中教授贝叶斯建模和统计学课程。

Daniel J. Schad(https://danielschad.github.io/)是德国波茨坦HMU健康与医科大学心理学系定量方法学教授。他在德国波茨坦大学和美国安娜堡密歇根大学学习心理学。他在波茨坦大学获得认知与数理心理学博士学位,研究方向为眼动控制的计算模型和无意识阅读。随后,他在德国柏林夏里特医科大学(部分时间也在波茨坦大学)进行了为期五年的计算精神病学领域博士后研究,期间曾到瑞士苏黎世联邦理工学院和英国伦敦大学学院进行学术访问,研究酒精依赖中的无模型和基于模型的决策制定以及巴甫洛夫-工具性迁移,以及巴甫洛夫条件作用背后的认知和脑机制。他曾在波茨坦大学担任博士后研究员,从事认知科学中定量方法的研究,包括对比、显著性检验的性质、贝叶斯工作流程和贝叶斯因子分析,并曾担任蒂尔堡大学认知科学与人工智能系的助理教授。

Shravan Vasishth(http://vasishth.github.io)是德国波茨坦大学心理语言学教授,担任心理语言学和神经语言学(语言加工)教席。在获得印度新德里贾瓦哈拉尔·尼赫鲁大学日语学士学位后,他在日本大阪共度过了五年。在日本期间,他在大阪外国语大学学习日语,在大阪大学进行研究,并在一家专利法律事务所担任内部翻译。他在美国俄亥俄州哥伦布市的俄亥俄州立大学获得了计算机与信息科学硕士(2000–2002)和语言学博士(1997–2002)学位,并在英国谢菲尔德大学数学与统计学院获得了统计学硕士(2011–2015)学位。他是英国皇家统计学会的特许统计学家(编号128307)。他是开放获取期刊 Glossa Psycholinguistics的编委会成员。他的研究专注于对健康人群和语言障碍人群的句子加工进行计算建模,以及数学、计算、实验和统计方法(特别是贝叶斯方法)在语言学和心理学中的应用。他创办了一年一度的暑期学校"语言学和心理学中的统计方法"(SMLP),始于2017年:vasishth.github.io/smlp。他定期教授统计数据分析(贝叶斯和频率论方法)的短期课程。

第一部分 基础理念

1 引言

引言

我们在本书中将探讨的核心思想是,在给定一些数据的情况下,如何利用贝叶斯定理来量化我们对某一感兴趣的科研问题之信念的不确定性。在我们深入探讨基础理论及其应用的细节之前,熟悉以下主题是很重要的:概率的基本概念、随机变量的概念、概率分布以及似然的概念。因此,我们将从这些主题开始。

其中一些概念起初可能显得抽象,但它们对于进行贝叶斯分析非常相关。第一次阅读本书时,快速浏览本章并在阅读后续章节时根据需要返回参考,可能会有所帮助。

1.1 概率

非正式地,我们都理解概率这个术语的含义。我们经常谈论像今天下雨的概率这样的事情。然而,有两种不同的方式来思考概率。人们可以参照在重复观测中某事件可能发生的频率来思考其概率。这种概率概念在某种事物至少原则上可以重复发生的情况下很容易想象。一个例子是反复掷骰子时得到6点。

然而,当谈论独一无二的事件(如地震)时,这种频率论的概率观就很难站得住脚;在这里,概率表达的是我们对地震发生的不确定性。

基于频率的观点和基于不确定信念的观点在统计推断中各有其位,根据情况不同,我们将同时依赖这两种思维方式。

以下陈述并非概率论公理的形式化定义;更多细节(以及更精确的表述)请参见Blitzstein和Hwang(2014)、Ross(2002)、Kerns(2014)、Resnick(2019)或Kolmogorov(1933)(以及许多其他书籍)。请记住,不同教科书在呈现概率空间(下文定义)的基本结构时方式略有不同。

某事件发生的概率被定义为受到如下方式约束的。一个"某事件发生"的具体例子是一个结果——称之为——例如当我们向受试者提出10个是非题(比如说,关于句子含义的问题)时,得到9个正确()答案和1个错误()答案。一个例子是一串正确()和错误()答案的序列,如。另一个可能的结果是。因此,结果就是所有可能正确和错误答案序列,而样本空间Ω是所有可能结果的集合。

另一个重要概念是事件;接下来,对应于在提出10个问题时获得1个正确答案的事件,是结果{, , , …}的子集;换句话说,对应于获得1个正确答案的事件是一个包含10个元素的集合。类似地,对应于在提出10个问题时获得9个正确答案的事件是结果{, , …}的子集。

当我们进行实验时,如果我们得到了像这样的特定结果,那么我们就说事件{, , , …}发生了。一个概率空间还涉及两个关键要素:Ω的子集的一个集合族,记为,称为事件空间¹;以及一个实值函数,它为中的每个集合赋予一个数(一个概率)。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

在数据分析的语境中,我们将以下述方式谈论概率。考虑我们可能已经收集到的一些数据。这些数据可以是问题-回答准确性任务中的离散的0、1反应,也可以是来自眼动研究的以毫秒为单位的阅读时间的连续测量,或者是像"是"、"否"或"不知道"这样的多类别反应,又或者是微伏尺度上的电位。

在任何这类情况下,我们都会说数据是由一个随机变量生成的,我们将用大写字母如 Y 来表示它。

实际观察到的结果(0、1反应;阅读时间;像"是"、"否"、"不知道"之类的反应等)将与生成它的随机变量区分开来,用小写字母 y y来表示观察到的结果。我们可以称 y 为 Y 的一个实例;由于随机变异性,每一个新的观察结果都可能不同。

如果我们用数学形式重新表述以上与随机变量相关的非正式概念,就可以非常简洁地加以总结。数学表述的优势不仅在于简洁,还在于减少(并希望能消除)歧义。

因此,按照Blitzstein和Hwang(2014)的方式正式定义随机变量,我们将随机变量 Y 定义为从可能结果 ω 的样本空间 Ω 到实数系统的一个函数:

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

1.1 概率

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

1.2 条件概率

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

1.3 全概率定律

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

就目前而言,这就是我们需要了解的所有概率论知识!

接下来的章节将对随机变量的概念、与随机变量相关联的概率分布、指定参数上的先验分布意味着什么,以及如何使用先验和数据推导出 θ 的后验分布进行展开。

为使讨论具体化,我们将使用一个离散随机变量的例子——二项分布。在讨论完这个离散随机变量之后,我们将给出另一个例子,这次涉及连续随机变量——正态随机变量。

二项分布和正态分布是我们在本书初始阶段需要的典型示例。我们将根据需要引入其他随机变量:特别是,我们将需要均匀分布和贝塔分布。在其他教科书中,你还会遇到泊松分布、伽马分布和指数分布等。最常用的分布及其性质在大多数统计学教科书中都有讨论(见本章末尾的延伸阅读)。

1.4 离散随机变量:以二项分布为例

打开网易新闻 查看精彩图片

1.4 离散随机变量:以二项分布为例

打开网易新闻 查看精彩图片

为简单起见,假设要求10名受试者完成上述句子;每名受试者只做一次这个任务。这给我们提供了10次独立的试验,每次被编码为成功(产生了"umbrella")或失败(产生了其他词)。我们可以将成功次数相加,以计算10次试验中有多少次以"umbrella"作为回答。例如,如果在10次试验中出现了8次"umbrella",我们会估计产生"umbrella"的完形概率为8/10。

我们可以在R中重复生成成功次数的模拟序列(稍后我们将演示如何生成此类模拟数据的随机序列)。这里有一种情况,我们进行20次实验,每次实验有10次试验。

在我们查看用于生成此类模拟数据的R代码之前,需要一些记法约定以避免混淆。在我们下面用于生成模拟数据的函数(rbinom())中, n 指实验次数,在R函数的术语中即观测次数。相比之下,size 是试验次数。这意味着在下面的例子中, n 指所进行的实验次数;因为在R语言中这些被称为观测值,我们也将采用这一术语。因此,如果进行了20次实验,每次有10次试验,我们会说我们有20个观测值,每个观测值有10次试验。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

二项分布的概率质量函数写作如下。这里,再次注意记法是很重要的,因为考虑到我们之前看到的 rbinom 函数中的约定,存在混淆的可能性。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

一个关键点:参数的"最可能"值是相对于手头的数据而言的。目标是从数据中估计一个未知的参数值。这个估计出的参数值被选择为使得获得样本值(即数据)的概率(离散情况)或概率密度(连续情况)达到最大。这个参数值就是最大似然估计(MLE)。

来自某一特定样本的MLE并不一定总能给我们一个准确的 θ 估计。例如,如果我们以10次试验进行实验,得到10次中1次成功,那么MLE是0.10。即使真实的 θ 是0.7,我们也可能恰好偶然地只观察到10次中1次成功。如果我们以不断增加的样本量重复进行实验,随着样本量的增加,MLE会收敛到参数的真实值。图1.3(b)说明了这一点。这里的关键点是,在较小的样本量下,来自特定数据集的MLE可能指向真实值,也可能不指向。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

因此,随机变量 Y Y的累积分布函数(CDF)与相应的概率质量/密度函数相关,其写法如下:

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

1.4.2.4 从二项分布 Binomial(n, θ) 生成模拟数据

我们可以通过指定观测值或实验次数(n)、试验次数(size)以及成功概率 θ ,从二项分布中生成模拟数据。在R中,操作如下:

打开网易新闻 查看精彩图片

上述代码生成一个具有10次试验的实验中成功次数。重复运行上述代码;每次我们会得到不同的成功次数。

如前所述,如果只有一次试验,那么我们有的就是伯努利分布,而不是二项分布。例如,如果我们有来自伯努利分布的10次实验,其中成功概率为0.5,我们可以使用 extraDistr 包中的函数 rbern() 来模拟数据,操作如下。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

1.5 连续随机变量:以正态分布为例

现在我们用连续分布来重新审视随机变量的概念。假设我们有一个以毫秒为单位测量的阅读时间数据向量 y ,且来自正态分布。正态分布由两个参数定义:位置参数,即其均值 μ ,决定其中心位置;以及尺度参数,即其标准差 σ ,决定围绕中心点的离散程度。

正态分布的概率密度函数(PDF)定义如下:

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

与离散示例中一样,概率密度函数、累积分布函数和累积分布函数的逆函数使我们能够提出诸如以下的问题:

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

同样,从特定(模拟或真实)数据集计算出的样本均值和样本标准差不一定接近各自参数的真实值。尤其是在样本量较小时,最终可能会得到对均值和标准差的错误估计。

顺便提一下,模拟数据可用于生成各种统计量。例如,我们可以计算下分位数和上分位数,使得95%的模拟数据包含在这些分位数之间:

打开网易新闻 查看精彩图片

稍后,在我们使用 Stan/brms 拟合模型并获得参数的样本之后,这个函数将被用来生成汇总统计量。

1.5.1 一个重要区分:连续随机变量中的概率与密度

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

在本书后面,我们在进行贝叶斯建模时将使用这种截断分布,而当我们使用它们时,我们希望将截断分布乘以因子 k ,以确保它仍然是一个合适的概率密度函数,其曲线下的面积之和为1。截断正态分布将在在线章节A.2中更详细地讨论。

1.6 双变量和多变量分布

到目前为止,我们只讨论了单变量分布;这些是仅涉及一个变量的分布。例如,当我们谈论来自二项分布或正态分布生成的数据时,这些就是单变量分布。

也可以指定具有两个或多个维度的分布。一些例子将清楚地说明什么是双变量(或更一般地,多变量)分布。

1.6.1 示例1:离散双变量分布

从离散情况开始,考虑如下所示的离散双变量分布。这些数据来自一项实验,其中在每个试验中记录了李克特可接受性评分和问题-回答准确率(数据来自Laurinavichyute 2020的一项研究,此处经许可使用)。通过加载R包 bcogsc 来加载数据。

打开网易新闻 查看精彩图片

图1.6展示了两个随机变量 X 和 Y 的联合概率质量函数。随机变量 X 由7个可能值组成(这是1–7的李克特反应量表),而随机变量 Y 是问题-回答准确率,其中0代表错误回答,1代表正确回答。也可以将图1.6以表格形式展示;见表1.2。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

边际概率之和为1,正如它们应该的那样。表1.3显示了边际概率。

打开网易新闻 查看精彩图片

要计算 X 的边际分布,需要对所有 Y 进行求和;而要计算 Y 的边际分布,则需要对所有 X 进行求和。我们说我们是在边际化掉我们正在求和的那个随机变量。也可以使用条形图将这两个边际分布可视化(图1.7)。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

1.6.1.3 协方差与相关性

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

可视化会有所帮助。下面的图显示了零相关(图1.8)、负相关(图1.9)和正相关(图1.10)的双变量分布。

在本书中,我们将大量使用这种多变量分布,并且很快了解如何生成相关的模拟双变量或多变量数据将变得重要。那么接下来让我们来看这一点。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

图1.11确认了模拟数据呈正相关。

打开网易新闻 查看精彩图片

1.6.4 方差-协方差矩阵的分解

关于方差-协方差矩阵的最后一个有用事实——我们稍后会需要——是它可以分解为分量标准差和一个基础的相关矩阵。例如,考虑上面的矩阵:

打开网易新闻 查看精彩图片

可以通过将包含标准差的对角矩阵与相关矩阵进行左乘和右乘,来重新组合方差-协方差矩阵

打开网易新闻 查看精彩图片

方差-协方差矩阵的这种分解和重新组合,在我们开始在Stan中构建分层模型时将变得重要。

1.7 一个重要概念:边际似然(积分掉一个参数)

在这里,我们引入一个在本书中会多次出现的概念。我们在此展开的概念称为"积分掉一个参数"。当我们在下一章遇到贝叶斯法则时,以及在后来的章节(第13章)中使用贝叶斯因子时,我们将需要这个概念。

积分掉一个参数指的是以下情况。这里使用的例子讨论的是二项分布,但该方法通常适用于任何分布。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

这个表达式计算的内容类似于我们上面用三个离散参数值计算的内容,不同之处在于求和是在从0到1的连续空间上进行的。我们说参数 θ 已经被积分掉了,或者说被边际化了。积分掉一个参数将是本书中非常常见的操作,但我们永远不需要自己进行计算。对于上述情况,我们可以在R中计算该积分:

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

1.8 一些有用的R函数总结

表1.5以二项分布和正态分布为例,总结了与概率质量函数和概率密度函数相关的不同函数。

打开网易新闻 查看精彩图片

1.9 总结

本章简要回顾了概率论中的一些非常基本的概念、单变量离散和连续随机变量,以及双变量分布。我们遇到的一组重要函数是不同分布的 d-p-q-r 函数族;这些函数对于理解常用分布的性质、可视化分布以及模拟数据非常有用。分布在本书中将发挥核心作用;例如,知道如何可视化分布对于决定参数的先验分布将很重要。我们学到的其他重要概念包括边际概率和条件概率、边际似然,以及如何定义多变量分布;这些概念将在贝叶斯统计中发挥重要作用。

1.10 延伸阅读

关于概率的非正式但有用的讨论出现在Spiegelhalter(2024)中。对统计学所需数学基础的快速回顾可在Fox(2009)以及Gill(2006)的短书中找到。对高级贝叶斯建模所需的数学背景更全面的介绍是Jordan和Smith(2008)。Morin(2016)和Blitzstein与Hwang(2014)是概率论的可读性入门教材。Ross(2002)提供了更高级的论述,讨论了随机变量理论并展示了概率论的应用。上述教科书也讨论了一些关于随机变量的基本结果(例如,随机变量之和的期望和方差);其中一些结果将在本书后续章节中需要。对数理统计(涵盖经典频率论理论)的良好形式化入门教材是Miller和Miller(2004)。Kerns(2014)的免费书籍以非常全面和系统的方式从零开始介绍了频率论和贝叶斯统计;该书的源代码可从 https://github.com/gjkerns/IPSUR获取。Bob Carpenter的开放获取书籍《概率与统计:基于模拟的导论》也值得研究:https://github.com/bob-carpenter/prob-stats。Fieller(2016)提供了统计学所需的矩阵代数的全面介绍,并附有使用R的示例。常用概率分布在Miller和Miller(2004)、Blitzstein与Hwang(2014)以及Ross(2002)中有详细介绍。关于连续单变量分布的有用参考书是Johnson、Kotz和Balakrishnan(1995)。

原文链接: https://www.researchgate.net/publication/393753745_Introduction_to_Bayesian_Data_Analysis_for_Cognitive_Science