打开网易新闻 查看精彩图片

认知神经科学前沿文献分享

论文信息:Peng Wang、Fred Paas,Five Educational-Psychology Lenses for Training and Evaluating AI Models,Educational Psychology Review,2026。DOI:10.1007/s10648-026-10195-8

引言

假设一名学生在老师提供例题、解题模板和关键提示时,数学考试拿到了满分。

但只要撤掉模板、换一种题目表述,或者把数字和情境稍作修改,他的成绩就迅速下降。

我们还会说他真正掌握了数学推理吗?

今天的大模型,可能正面对同样的评价问题。

模型在Benchmark上不断刷新纪录,发布会上充满“推理能力提升”“对齐能力增强”“接近专家水平”等表述。但一个越来越难以回避的问题是:

高分究竟代表模型获得了稳定能力,还是代表它越来越会做特定形式的考试?

2026年发表于《Educational Psychology Review》的一篇文章,尝试用教育心理学重新审视AI训练与评估。作者王彭和 Fred Paas 提出了五种观察视角:课程设计、教学脚手架、评估效度、社会学习和伦理对齐。

这篇文章提出的是一个更加克制、也更加有意思的观点:

教育心理学积累了大量识别死记硬背、应试训练、教师依赖和评分投机的方法。这些方法,同样可以用来审查大模型的能力声明。

核心理论

分数不是能力本身

教育测量学家 Messick 的有一个著名的效度理论,其观点是:效度不是一张试卷天然具有的属性,而是我们能否根据考试成绩,合理推断被测者具备某种能力,放在大模型上,这意味着:一个模型在数学Benchmark上得了90分,并不自动证明它具备“数学推理能力”。还需要排除至少四种替代解释

1. 支持依赖:只有在特定提示词、思维链或工具存在时才能答对;

2. 代理指标优化:学会了能拿分的表面特征,而不是目标能力;

3. 评分者特异性迎合:学会讨好某类标注者,而非形成稳定行为;

4. 应试与污染:见过测试题、相似题,或专门针对Benchmark进行优化。

所以关键或许不在于模型得了多少分,这个分数究竟允许我们对模型作出什么推断?或许是更值得关注的地方

五个教育心理学“镜头”

教育心理学视角

对应的AI实践

作者要求追问的问题

课程设计

数据筛选、难度排序、任务调度、奖励塑形

换一种任务分布后,能力还能迁移吗?

教学脚手架

Few-shot示例、思维链、提示词、工具调用

撤掉或扰动支持后,表现是否崩溃?

评估与效度

Benchmark、排行榜、奖励模型

测到的是能力,还是刷题技巧?

社会学习

模仿学习、RLHF、RLAIF

模型学到了原则,还是迎合某类老师?

伦理对齐

安全训练、拒答规则、宪法式原则

行为是否能跨语言、角色和情境保持稳定?

第一副镜头:训练数据也是一份“课程表”

课程学习并不是新概念。机器学习中早已存在从简单样本到复杂样本、困难样本挖掘、任务分阶段训练以及自适应课程等方法。

文章的新意不在于再次告诉我们“数据顺序很重要”,而是要求开发者证明:

  • 更快收敛是否带来了更好的迁移?

  • 训练中定义的“困难样本”,真的代表概念难度吗?

  • 课程是否缩窄了模型接触的数据分布?

  • 换一种表达、领域或任务后,提升是否仍然存在?

第二副镜头:提示词可能只是“拐杖”

文章认为,所谓“提示词工程”,从教育学角度看更接近教学脚手架设计

Few-shot示例类似教师提供例题;思维链提示类似要求学生写出解题步骤;检索、计算器和外部工具则提供额外支持。

但脚手架的核心不只是“加上以后成绩提高”,而是要进行渐隐测试

  • 不再要求逐步思考,准确率还剩多少?

  • 换一种提示模板,效果是否消失?

  • 删除示例或更改示例顺序,模型是否崩溃?

  • 在结构相同、表面不同的问题上,方法能否迁移?

如果一撤掉“让我们一步一步思考”,模型就不会推理,那么更谨慎的结论应当是:这个模型在特定外部结构支持下表现较好。

第三副镜头:Benchmark也会诱发“应试教育”

当一个指标开始决定资源、声誉和模型排名时,它就不再只是测量工具,也会反过来改变训练行为。

开发者会围绕它选数据、调参数、设计提示和修补错误。最终出现的提升,可能来自:

  • 训练集和测试集污染;

  • 对题型和表达格式的熟悉;

  • 利用标注瑕疵和风格线索;

  • 针对排行榜进行专项训练;

  • 通过奖励模型的漏洞获得高分。

这和学校中的“教学围着考试转”非常相似:学生分数提高了,但考试与真实能力之间的关系反而变弱。

第四副镜头:RLHF里的“老师”是谁

通过人类反馈进行强化学习,本质上会让模型更倾向于产生标注者喜欢的回答。

问题在于,“人类偏好”从来不是一个天然统一的变量。它取决于:

  • 标注者来自什么文化和职业背景;

  • 标注规范如何书写;

  • 标注者是否一致;

  • 什么风格更容易被判为“高质量”;

  • 少数群体的偏好是否被平均值淹没。

模型可能没有学会一个普遍原则,只是学会了某一批评分者喜欢的语言风格。

因此文章提出,不应只报告一个平均偏好分数,还应报告评分者间一致性、不同评分者群体的影响,以及模型在不同语言、角色设定和社会情境中的稳定性。

文章还进一步指出,用另一个AI生成训练数据时,那个AI同样是“老师”。它自身的偏见、行为倾向和隐含规则,可能作为“隐藏课程”传递给下一代模型。

第五副镜头:安全拒答不等于道德理解

模型在常见危险提示下稳定拒答,只能证明它在这些条件下表现出了可靠行为。

这不等于它:

  • 理解了伤害为什么错误;

  • 形成了稳定价值观;

  • 具备人类意义上的道德判断;

  • 在所有新情境中都会坚持相同原则。

作者建议用新的价值冲突、提示改写、角色切换、多语言输入和对抗性包装来测试对齐。如果模型换个角色、换种语言或换个叙事框架就改变立场,那么所谓对齐可能只是模板化服从。

五点建议

作者最终把框架压缩为五件事:

  1. 记录训练课程

    :公开不同阶段的数据来源、顺序和难度特征;

  2. 开展脚手架撤除实验

    :报告有提示和无提示、使用工具和不使用工具时的差异;

  3. 把Benchmark当成高风险测量工具

    :提前识别捷径,并设定更新与退役机制;

  4. 审计教师信号

    :记录人类标注者和AI教师的构成、规范、一致性与来源;

  5. 区分行为与理解

    :可靠拒答可以称为可靠行为,不应直接写成“内化了价值观”。

这五条其实构成了一份很实用的模型评测审查表

核心结论

文章把大模型开发重新描述为一套类似教育过程的系统:

  • 训练数据及其顺序,相当于课程设计

  • 提示词、示例、思维链和工具,相当于教学脚手架

  • 人类反馈和AI反馈,相当于教师评价与社会化

  • Benchmark相当于考试

  • 对齐训练相当于某种功能意义上的规范教育

作者认为,现有大模型取得更高分,并不等于它获得了更强的能力。它可能只是更依赖提示、更擅长迎合评分者,或者更会钻评测规则的空子

分享人:王彭,天天

审核:PsyBrain 脑心前沿编辑部

你好,这里是「PsyBrain 脑心前沿

专注追踪全球认知神经科学的最尖端突破

视野直击 Nature, Science, Cell 正刊 及核心子刊与顶级大刊

每日速递「深度解读」与「前沿快讯

科研是一场探索未知的长跑,但你无需独行。欢迎加入PsyBrain 学术社群,和一群懂你的同行,共同丈量脑与心智的无垠前沿。

点击卡片进群,欢迎你的到来

一键关注,点亮星标 ⭐ 前沿不走丢!

打开网易新闻 查看精彩图片

一键分享,让更多人了解前沿