人类认知系统需要从零星的经验样本中推断环境中的概率分布规律,这种推断能力支撑着从知觉推断到适应性决策的广泛认知功能。学习者内部构建的分布表征与真实统计结构之间究竟存在多大偏差,过去由于缺乏直接的测量手段而长期悬而未决。2026年8月8日,北京大学心理与认知科学学院张航研究员团队在《Nature Communications》上发表论文,题为“Human learning of probability distributions is biased toward moderate structural complexity”。研究团队设计了结构化分布报告任务,让被试在观察序列样本后直接报告他们感知到的概率密度背后的隐结构,包括簇的数量、中心、宽度和权重,并且在后续的识别任务中要求被试从多个候选分布中选出与样本最匹配的一项。他们还构建了系列计算模型,通过GPU加速的并行模拟拟合每位被试的行为数据。整个工作涵盖视觉和数字两种刺激模态、多种数值尺度、自由报告和强迫选择两种任务范式,并且包含一项预先注册的实验,总共招募了数百名被试。
第一个实验中的被试观看从单高斯或混合高斯分布中抽取的10个或70个样本,随后在屏幕上用鼠标标记每个感知到的簇的中心,并调整其宽度和相对权重。真实分布包含1到4个簇,但被试报告1个簇的试次仅占全部试次的2%,在单高斯条件下平均报告了3.03个簇。观测样本从10个增至70个时,报告簇数量反而上升(F(1,20)=124.31, p<0.001),而真实分布为1簇时报告数显著高于2、3、4簇条件。报告出的相邻簇之间几乎没有重叠,簇宽窄小且相互分离,这使得报告密度的曲线上出现额外的波动峰。密度估计误差随样本量增加而下降(F(1,20)=83.21, p<0.001),表明被试确实在学习整体密度,但结构表征却走向了过度复杂化。回归分析显示被试对均值和标准差的跟踪斜率显著大于零,但对更高阶矩(偏度)的敏感性明显减弱,斜率比较也证实了这一层级差异。
第二个实验使用来自文献的多种非对称分布形态,同样发现被试偏好报告2到3个簇,且同一组样本的两次重复呈现之间报告一致性高于随机水平。第三个实验将刺激从视觉点阵改为阿拉伯数字序列,并且将被试分为宽窄两个尺度组,结果显示视觉模态中的偏差在数字模态中同样出现,尺度变化对报告簇数没有显著影响(组间F=0.05, p=0.831)。在后续的分布识别实验中,被试在二选一或四选一的任务中仍然系统性地选择具有2到3个簇的选项,即便所有选项具有相同的均值和方差,迫使被试依赖分布形状做出判断。在预先注册的第八个实验中,研究团队利用DEE模型生成了与真实高斯分布对样本具有近似对数似然的多峰选项,被试选择多峰选项的比例显著高于50%机会水平(t(215)=8.71, p<0.001),并且这种偏向在第一个试次中即已出现。控制试次中多峰选项的对数似然远低于真实分布,被试选择多峰选项的频率则显著下降,这排除了单纯的响应偏好解释。
研究团队构建了一个名为失真经济扩展的计算模型来解释这些现象。该模型假设被试在每观察到一个新样本时,需要决定将其归入已有簇或者新建一个簇,而新建簇的概率随已有簇数量增加按指数规律下降(参数r>0),这限制了记忆负荷的无限增长。模型还包含概率失真参数β,使得簇的权重分配偏离实际频次,反映了个体对频次信息的主观扭曲。研究团队利用GPU并行仿真对每位被试的完整报告数据进行最大似然估计,并通过AIC进行模型比较。DEE模型的AIC显著低于传统的中国餐馆过程和变分高斯混合模型,拟合所得参数r和β在不同实验中高度一致,且相对簇宽度约为整体标准差的1/3,与贝叶斯聚类中的常用启发式规则吻合。参数恢复分析验证了模型的可识别性,并且模型在多个报告维度(簇数、簇重叠度、特征协变)上的模拟结果与人类数据高度匹配。
READING
BioPeers
热门跟贴