打开网易新闻 查看精彩图片

你有没有想过,一个真正好用的AI辅导老师,最难的部分不是懂知识,而是懂学生?

假设你在开发一个数学辅导AI,它讲得头头是道,逻辑严密,例题清晰。但真正用起来你会发现一个尴尬的问题:你根本不知道它讲得好不好。因为要验证这件事,你需要成千上万个真实学生去试用,记录他们听懂没听懂,记录换一种讲法他们会不会突然开窍。这个过程慢、贵,而且没法批量重复。

于是有人想到一个办法:干嘛不用AI来模拟学生呢?让AI辅导老师去教一个"假学生",看假学生学得怎么样,用这个反馈来改进辅导老师。这个想法听起来很美好,但当研究者真正动手做的时候,发现了一个此前没人认真面对的矛盾。

模拟学生这件事,比想象中难两倍

先说说已经存在的两条路子,以及它们各自的死穴。

第一条路是行为追踪模型,比如知识追踪(knowledge tracing)这类方法。

知识追踪:一种通过分析学生历史答题记录,推测其对某个知识点掌握程度的建模方法,常见于智能教育系统。

这类模型的强项是,它是从真实学生数据里训练出来的,能够比较准确地复现某个学生的答题习惯,比如这个学生总是在应用题上栽跟头,那个学生擅长口算但怕几何证明。但它的死穴也很明显:这类模型只认识"对"或"错"这种标签化的反馈,你没法给它塞一段自然语言的讲解,让它读懂"你这道题错在把负号漏掉了"这种带解释的指导。它天生没有接收文字辅导的接口。

第二条路是直接拿大语言模型来"角色扮演"学生,你给它写一段人设:"这是一个数学基础薄弱、容易粗心的初二学生",然后让它去回答问题、听老师讲解。

这条路的好处是它能听懂任何自然语言的指导,跟它说什么它都能给出像模像样的反应。但问题在于,这类被prompt出来的角色扮演,往往并不真的按照人设去犯错。它可能读了那段"基础薄弱"的描述,却依然把题目解对了,因为它本身的推理能力太强,压不住那份"我明明知道怎么做"的冲动。反过来它也可能画蛇添足,装得比设定还笨。

这就好比你请了一位特别专业的演员来演一个只会说三句英语的角色,结果他台词功底太扎实,一张嘴就露馅,观众一下子就出戏了。如果不解决这个问题会怎样?辅导AI拿这样的"假学生"练手,练出来的东西根本对不上真实学生的水平,等真正拿去教真人的时候,可能完全不管用。

这两条路各自守着一半的真相,谁也补不上另一半的洞。研究者把这两个能力总结成两个维度:一个叫行为保真度,一个叫指导响应度。

行为保真度:衡量模拟器对某道题的回答,是否真的贴近这个学生本人平时会给出的答案,包括他特有的错误习惯和擅长的地方。

指导响应度:给模拟器看一道题、学生原本的错误答案,再加上老师针对这个错误给出的讲解,看模拟器是否会朝着讲解引导的方向修正自己的答案。

这两个维度合起来,恰好对应教育心理学里一个经典概念,最近发展区(Vygotsky提出),也就是学生独立能做到什么程度,以及在有人帮助的情况下能进步到什么程度。这套理论早在动态评估(Dynamic Assessment)里就被拿来实际操作过,核心思路是:只看学生自己答得怎么样是不够的,还得看他在得到点拨之后,能不能真的往前迈一步。

前面提到的知识追踪模型,强在第一个维度,弱在第二个维度。角色扮演的大模型,恰好反过来,强在第二个维度,却在第一个维度上经常翻车。研究者把这两个方法在一个坐标系里画出来,一个偏左上,一个偏右下,真正理想的位置是右上角,两头都强。这篇论文要做的,就是找到一条路径,让模拟器既能站在右上角。

两阶段训练:先学"大家共通的",再学"这个人独有的"

问题找到了,接下来是怎么解决。这里有个现实困难:每个学生留下的数据都很少。

论文里给了个具体数字,第二语言英语写作数据集里,一个学生平均只写了3篇作文,超过三分之二的学生写的作文不超过5篇。这个规模,训练一个专门属于这个学生的大模型,几乎是不可能完成的任务,因为大模型是"数据饥渴型"的动物,喂它这么点数据,它要么记住了几个具体样本就再也泛化不了(过拟合),要么压根学不到东西。

研究者的解法是把训练拆成两个阶段。

第一阶段叫池化训练(pooled training),把这个领域里所有学生的数据混在一起,训练出一个"基础模拟器"。这个基础模拟器学到的是这个领域学生普遍会犯的错误、常见的答题格式、以及大家在收到老师指导后会怎么调整答案这种共性规律。

第二阶段叫个体特化(per-student specialization),拿这个基础模拟器,用某一个具体学生自己的数据继续微调,让它偏移到这个学生特有的风格上。

这个设计思路,其实很像学徒制的教学方式。一个新入行的木匠师傅,不会一上来就单独教一个学徒所有东西,那样效率太低,而是先让所有学徒一起上大课,学木工的通用技法:怎么锯直线、怎么打磨、怎么上漆。这是共性部分。等基本功打完了,师傅再针对每个徒弟的个人特点单独调教,这个人手劲大适合粗活,那个人细腻适合雕花。

如果跳过第一阶段,直接让每个学徒关起门来自己摸索,会发生什么?论文里做了个对照实验来验证这一点,非常直白:他们把第一阶段的池化数据换成"用同一个学生的1000条记录反复重复100遍",其他所有训练设置保持不变。结果是,行为保真度从0.5131掉到0.4602,指导响应度从0.9003掉到0.8276。这说明单纯堆同一个人的数据是没用的,学生之间共享的那些规律,是没法从一个人身上单独学出来的,必须靠"很多人"这个池子才能提炼出来。

三个战场:棋局、作文和数学题

光有理论框架不够,研究者选了三个完全不同的领域来验证这套方法:国际象棋、第二语言英语写作、数学解题。这三个领域的挑选也有讲究,一个是有限的、规则明确的动作空间(象棋走法),一个是开放的自由文本创作(写作文),一个是选择题式的结构化答案(数学多选题)。三种截然不同的"答案形式",恰好能测试这套框架是不是真的通用。

在国际象棋里,数据来源是Lichess,一个开源的在线国际象棋平台,记录着真实玩家之间的对局。

Lichess:一个开源在线国际象棋平台,玩家在此对弈的每一局棋都会被记录,包含棋盘状态、双方走法等信息,且这些数据以CC0协议公开发布,任何人都能免费用于研究。

每一步棋都被拆解成"局面→玩家实际走的棋"这样的记录,模拟器的任务就是根据局面预测这个特定玩家会走哪一步。

在第二语言写作里,用的是EFCAMDAT语料库,收录了大量非英语母语学习者写的英语作文,配上老师给出的批改。

EFCAMDAT:剑桥大学与在线教育机构EF合作建立的英语学习者作文语料库,涵盖不同水平学生写的作文及教师标注的语法错误批改,是研究第二语言习得的重要资源。

模拟器的任务是生成一篇作文,让它的错误频率和错误类型分布,跟这个学生真实的写作水平对得上。

在数学领域,用的是FoundationalASSIST数据集,来自ASSISTments在线辅导平台,收录了学生做题的答案记录,配合美国的Common Core数学课程标准。

Common Core:美国大部分州采用的K-12数学与英语课程标准,规定了每个年级学生应该掌握的具体知识点,是美国基础教育评估体系的基石。

因为数学答案往往是开放式的自由文本,研究者把它转化成四选一的选择题形式:选项里包含这个学生自己给出的真实答案(无论对错),加上其他学生在同一道题上最常给出的几种答案作为干扰项。

为什么要用国际象棋作为主战场?因为象棋的走法空间是有限的,通常一个局面下合法走法就几十种,棋手的每一步棋都有唯一记录,没有歧义,而且Stockfish这样的顶级引擎能给出客观、精确到厘兵值(centipawn)的评分,让研究者能验证"指导有没有真的起作用"这件事,不会陷入主观评判的争议里。

Stockfish:目前公认最强的开源国际象棋引擎之一,能对任意棋局给出精确的局面评估,常被用作衡量走法优劣的客观标准。

数据说话:训练出来的模拟器到底强在哪

三个领域里,研究者做了一场对比赛,参赛选手包括:GPT-4o、GPT-5.4这两个闭源大模型(提示词里带学生画像去扮演学生),针对国际象棋专门的Maia2模型(一个基于真人棋局训练的、按棋力分级的走棋预测模型),以及研究者自己训练出的StudentSim。

Maia2:一款专门针对国际象棋人类行为建模的模型,通过大量真实对局训练,能根据玩家等级预测某个棋力段位的人大概率会走哪一步棋。

在国际象棋上,行为保真度这一项,StudentSim拿到0.515,Maia2是0.4535,GPT-5.4只有0.2316。这个数字差距翻译成人话就是:同一个棋局,三个真实棋手可能各自走出三步完全不同的棋(一个推中路兵、一个走稳健布局、一个用象钉住对方马),Maia2会把三个人都预测成同一步"棋力平均值走法",GPT-5.4虽然读了每个人的历史棋谱,却三步都猜错了,StudentSim是唯一一个三步全对的。

这个差距背后的原因是,Maia2的条件只有一个玩家等级(ELO分数),这就好比只知道一个人考试平均分是85分,就想推断他这道具体的题会怎么答,信息量根本不够撑起这么精细的预测。而GPT-5.4虽然读了这个玩家过去打的比赛记录,但一段文字描述,很难精确约束一个具体局面下该走哪一步棋,这就像你看了一份关于某人性格的长篇描述,却依然猜不准他明天午饭会点什么菜。

指导响应度这一项差距更明显。StudentSim拿到0.9067,GPT-5.4是0.7186,Maia2只有0.2721。Maia2的低分是因为它压根没有输入通道来接收自然语言指导,你跟它说再多话它都听不进去,只能原地重复玩家原来的失误。这一项StudentSim领先的幅度更能说明问题的核心:并不是StudentSim比GPT-5.4聪明,而是它真的学会了从一段指导性的文字里,反推出老师想让它得到的正确结论。

论文里有个特别典型的例子。一个玩家在某局里推错了一步兵(centipawn评分从+425直接掉到-656,这是一步严重的失误),引擎认为最佳走法是激活国王,但老师给的指导是苏格拉底式的,用一连串反问句去引导学生自己想明白,比如"这一步之后局势会怎么变化?如果换一个更能激活国王的走法,情况会怎样不同?"全程没有直接说出正确走法。

Maia2完全无视这段话,继续走了原来的错棋。GPT-5.4读懂了这段话在说"应该走王步",但选错了具体的王步(走了一个不同的错误方位)。StudentSim顺着这一串反问的逻辑,推出了正确的那一步。这个案例揭示了一件有意思的事:一个只有40亿参数的小模型,靠着针对性训练,在这类需要"自己悟出答案"的高难度指导模式上,反而超过了参数量大得多的闭源模型。这说明多轮次训练确实教会了模型如何跟着指导逻辑走,而不只是投机取巧地在提示词里找现成答案抄。

三个领域的结果趋势是一致的:无论是国际象棋、写作还是数学,StudentSim在保真度和响应度两项上都超过了所有对照组,具体数字可以看下面这张表。

| 领域 | 指标 | 基线(Maia2/未训练模型) | GPT-4o | GPT-5.4 | StudentSim |

| 国际象棋 行为保真度 | top-1准确率 | 0.4535 | 0.2163 | 0.2316 | **0.5150** |

| 国际象棋 指导响应度 | 修正走法命中率 | 0.2721 | 0.7655 | 0.7186 | **0.9067** |

| 英语写作 行为保真度 | 错误画像匹配度 | 0.5130 | 0.4718 | 0.5141 | **0.5624** |

| 英语写作 指导响应度 | 修正片段命中率 | 0.0200 | 0.3883 | 0.5950 | **0.6417** |

| 数学 行为保真度 | 四选一准确率 | 0.4919 | 0.5121 | 0.6121 | **0.6384** |

| 数学 指导响应度 | 答案修正命中率 | 0.6132 | 0.6940 | 0.7099 | **0.9181** |

反过来当老师的教练:让模拟学生给辅导AI打分

前面说的都是"怎么造一个更像学生的模拟器",但这套系统最终的价值不止于此。研究者做了一个概念验证实验:把训练好的StudentSim,反过来当作强化学习里的奖励模型,去训练一个真正的AI辅导老师。

这个思路的逻辑是这样的:辅导老师给出一段讲解,冻结的学生模拟器读了这段讲解之后修正自己的答案,如果修正后的走法比之前更好,就说明这段讲解有效,给辅导老师的策略打个正分。反复训练下去,辅导老师就会越来越懂得怎么讲能让"学生"进步。

GRPO:一种强化学习中常用的策略优化算法,全称Group Relative Policy Optimization,通过组内相对比较来更新模型策略,不需要额外训练一个价值网络。

研究者对比了三种情况:完全不做强化学习的辅导AI(起点模型),用GPT-5.4扮演学生作为奖励来源训练出的辅导AI,以及用StudentSim作为奖励来源训练出的辅导AI。为了保证结果客观,他们请了一批有竞技水平的国际象棋选手,在不知道哪段回答来自哪个系统的情况下(盲测),从准确性、指导质量、个性化程度三个维度打分。

结果是StudentSim训练出的辅导AI三项全胜。准确性上,StudentSim版本达到90.5%的无误导性回答比例,没做强化学习的版本是75.7%,而用GPT-5.4当奖励训练出来的版本反而更低,只有71.6%。这个反差值得琢磨一下:用一个更强大的闭源模型当"假学生",训练出来的辅导老师反而在事实准确性上表现更差,原因是GPT-5.4扮演学生时经常会给出一些误导性的、不符合真实棋局的反馈,辅导AI学着去迎合这些不准确的反馈,结果自己也开始说胡话。

这就好比一个教练拿着一个演技浮夸、经常瞎指挥的假学员来练手,练出来的执教风格自然也带偏了。真正的学生模拟器之所以更可靠,是因为它是从真实数据里训练出来的,它给出的反馈本身更贴近现实。

值得一提的是,StudentSim在这个奖励模型里还搭载了两个额外的检测头,一个专门检查辅导老师的讲解风格是不是符合预设的教学风格(比如是否保持苏格拉底式提问),另一个专门检查讲解里有没有描述错棋盘状态(比如说错了棋子在哪个格子上,这种事实性错误)。这两个检测头之所以能实现,是因为StudentSim是本地部署、开放权重的模型,研究者可以直接读取它内部的隐藏状态来做轻量级的探针训练。而闭源的GPT-5.4就没法做到这一点,你没法在一个只能通过API调用的黑箱模型上加装这种探针,这也是开放本地部署的模拟器相比闭源API多出来的一层实用性优势。

这套框架从提出至今还只是一个概念验证,主要在国际象棋这个规则明确的领域里跑通了。它没有在真实学生身上做过部署验证,也没有覆盖学生跨越更长时间的学习曲线,比如知识是怎么被记住又被遗忘的,这些更复杂的长期动态,是论文作者自己也承认还没触及的方向。

Q&A

Q1:StudentSim是什么?

A:StudentSim是一个训练AI学生模拟器的框架,通过池化训练加个体特化两个阶段,让每个模拟器既能复现真实学生的答题风格和错误习惯,又能理解并响应老师的自然语言指导,从而为AI辅导系统提供高质量的模拟反馈。

Q2:StudentSim和普通的AI角色扮演学生有什么区别?

A:普通角色扮演大模型虽然能听懂指导,但常常不按人设犯错,保真度低。StudentSim用真实学生数据训练,既能复现学生特有的错误模式,又能听懂老师的讲解并据此修正答案,在两个维度上都表现更好,实测在国际象棋、写作、数学三个领域都超过了GPT-5.4等闭源模型。

Q3:StudentSim能用来做什么实际的事?

A:论文里做了个概念验证,把训练好的StudentSim当作强化学习的奖励模型,去训练一个国际象棋辅导AI。结果显示,用StudentSim训练出的辅导AI在准确性、指导质量、个性化程度上,都优于没做强化学习的版本和用GPT-5.4当奖励训练出的版本。