打开网易新闻 查看精彩图片

这项由微软研究院联合清华大学、北京大学研究人员共同完成的研究,于2026年7月发表在预印本平台arXiv上,论文编号为arXiv:2607.18110。感兴趣的读者可以通过该编号检索到完整论文。

**一个关于打分与辅导的故事**

假设你正在备考一门写作课,有两种老师可以选择。第一种老师每次看完你的作文,只给你打一个分数:7分。你拿到这个7分,完全不知道哪里写得好、哪里写得差,只能凭感觉再写一遍,期待下次分数能高一点。第二种老师不只给分,还告诉你:"你的文章用词重复太多,'很好'这个词出现了五次,可以换成更具体的描述;另外,你的论据太抽象,如果能加上一个真实的生活场景会更有说服力……"同样是评估你的作文,这两种老师的反馈价值天差地别。

这个打分老师与辅导教练的区别,正是微软研究院这篇论文想要解决的核心问题。研究团队提出了一个叫做"体验学习"(Experiential Learning,简称EL)的新框架,把AI训练过程中那个只会打分的"评委",升级成了一个能给出实质性指导的"教练"。

**一、AI是怎么学习的,以及问题出在哪里**

要理解这项研究,先得了解目前大语言模型(就是ChatGPT、Claude这类AI)是怎么变得越来越"聪明"的。

AI在经过基础训练之后,还需要经历一个"打磨"阶段,让它的回答更符合人类的期望。其中一种主流方法叫做"强化学习"——原理其实和训练宠物有点像:做对了就给奖励,做错了就扣分,AI会慢慢朝着"得高分"的方向进化。

在这个过程中,需要有人来评判AI的回答好不好。由于人工评估太慢太贵,研究人员想出了一个聪明的办法:让另一个AI来当评委,这个评委AI被称为"LLM-as-a-Judge"(AI担任裁判)。评委AI会根据一套评分标准,给被训练的AI的每一条回答打一个分数,比如1到10分。被训练的AI就根据这些分数来调整自己,争取下次得更高分。

这套方法在有明确答案的任务上效果很好。比如数学题——答案要么对要么错,分数能准确反映表现。但问题在于,现实中很多任务并没有唯一的标准答案。一篇旅游攻略、一段创意文案、一份建议信——这些回答的质量牵涉到好多维度:事实是否准确、表达是否清晰、逻辑是否连贯、风格是否得体……

当评委AI把这些复杂的评估最终压缩成一个数字——比如"7分"——大量有价值的判断信息就白白浪费了。更麻烦的是,很多质量不同的回答会得到相同的高分,比如都得了9分,但其中一篇其实在某些细节上明显更好。在分数层面,这两篇回答对AI来说完全一模一样,训练就陷入了瓶颈。

这就像你参加一个烹饪比赛,裁判只告诉你"这道菜75分",却不告诉你是调味出了问题还是火候没掌握好。你只能一遍遍做菜猜原因,进步速度当然快不起来。

**二、把评委变成教练:体验学习的核心思路**

微软研究院的团队提出的解决方案,用一句话概括就是:与其让评委AI把评估结果压缩成一个冷冰冰的数字,不如让它把那些评估过程中产生的真正有价值的分析,转化成可供学习的"经验知识"。

以文章开头那个摩洛哥旅游攻略为例。评委AI读完之后,它其实内部已经分析了很多东西:这篇文章反复用"很棒"这个词来形容一切,缺乏具体描写;而在描写集市的那段话里,把气味、声音和视觉感受结合在一起的写法很成功,让人有身临其境的感觉。

在原来的方式下,这些分析全部被丢弃,只留下最后的"7分"。在新的体验学习框架里,评委AI转变角色,成为"LLM-as-a-Coach"(AI担任教练),它会把这些分析提炼成可以迁移的经验建议,比如:"描述场景时应该调动多种感官,而不是堆砌形容词;把抽象的感受落地成具体的细节,读者才能产生共鸣。"这些建议不是针对这一篇文章的一次性修改意见,而是适用于类似写作任务的通用策略。

这份"经验知识"会被提供给一个"教师模型",教师模型在获得这些经验指导后,会产生一套更好的回答模式。被训练的AI(称为"学生模型")需要让自己的输出更接近这个教师模型,从而把这些经验真正内化进自己的参数里。整个过程就像一个学生看着教练示范,然后反复练习直到把技巧变成本能——等到真正上场时,教练不需要在旁边指导,学生已经把经验变成了自己的能力。

**三、信息带宽:为什么"一个数字"和"一段文字"差距如此巨大**

研究团队还用了一个信息理论的视角来解释为什么这种方法有效,这个解释本身就很有启发性。

把问题转换成信息传输来思考:从评委AI到被训练AI,每次评估能传递多少有用信息?一个1到10的整数分数,理论上最多能携带约3.3比特的信息量——大概相当于区分不到10种不同情况的信息。就算用更精确的浮点数表示,也不过16比特左右。

而体验学习中,教练AI生成的经验知识通常有几百到上千个词。以1024个词为例,从一个15万词汇量的语言模型里选出来的这段文字,理论上能携带的信息量高达17600比特——是一个数字分数的5000多倍。

当然,研究团队也诚实地说明,这个"5000倍"是理论上限,不代表实际有效信息量就真的多了5000倍——就像一本1000页的书,实际传递的有效知识不一定比一篇精华10页的论文多5000倍。但这个对比确实说明了一个根本性的问题:用一个数字作为学习信号,从一开始就把绝大部分有价值的反馈信息掐断了。

这种"信息带宽"的差异,在训练进入后期阶段会显得尤为关键。当AI已经能写出相当不错的回答,几乎每次都能得到9分或10分的时候,分数已经无法区分这些回答之间的细微差别了——就像所有优等生都得了满分,你就没法知道他们各自的强项在哪里。而经验知识依然能捕捉到这些微妙的差异,帮助AI在"已经很好"的基础上继续精进。

**四、实验是如何设计的,结果怎么样**

研究团队用两个不同系列的AI模型来测试这套方法,一个是阿里巴巴的Qwen3-8B,另一个是开源社区的OLMo-3-7B。为了排除偶然因素,他们还分别用两种不同的"教练"来提供反馈:一种是用AI本身来给自己当教练,另一种是用OpenAI的GPT-4o这个更强大的商业模型来担任教练。

训练数据来自一个叫WildChat-IF的数据集,包含7500条真实用户的对话请求,覆盖各种各样的开放性任务。每条请求都配有GPT-4o预先生成的评分标准,把回答质量分解成多个可以独立检查的维度。

训练完成后,研究团队不只看训练集上的表现,更重要的是检验在完全没见过的新任务上效果如何。他们选了四个独立的评测平台:AlpacaEval v2.0、WildBench、ArenaHard v2.0,以及CreativeWritingV3(创意写作专项测试)。这四个平台的题目和训练数据完全不同,是真正检验"有没有学到可迁移能力"的硬指标。

结果相当一致:在几乎所有测试场景和所有模型组合下,体验学习的表现都超过了传统的强化学习打分方式。以Qwen3-8B模型为例,用自己当教练时,强化学习在AlpacaEval上的胜率是37.3%,而体验学习达到了40.0%;在WildBench上,强化学习得分18.4,体验学习达到21.8。这些差距在AI训练领域算是相当显著的提升。

更有意思的是一个对比实验:研究团队专门拿训练集的一部分数据,在训练完成后评估两种方法在这些"见过的题目"上的表现,和在新题目上的表现进行对比。结果发现,强化学习在训练集上的分数提升(约+1.7分)实际上高于体验学习(约+1.3分),但在新题目上,体验学习的提升(+2.0分)明显超过强化学习(+1.1分)。

这个现象揭示了一个很重要的规律:强化学习在训练集上表现得更好,但这种"好"有一部分是通过学会迎合评分系统的偏好来实现的,并不是真正提升了能力。换句话说,AI学会了"考试技巧"而不是真正的知识。这在学术上被称为"奖励黑客"(reward hacking),就像学生专门研究出题规律、背答题套路来应付考试,而不是真正理解了知识。体验学习因为学的是可迁移的经验策略,而不是奔着一个具体分数去优化,所以反而在陌生题目上表现更稳健。

**五、细节很重要:哪种经验知识效果最好**

研究团队做了一系列精细的对比实验,来搞清楚"经验知识"到底该是什么形式,效果才最好。

他们对比了四种不同的方式。第一种叫"完整评语",就是把教练AI输出的所有文字——包括逐条分析每个评分维度的内容——原封不动地全部塞给教师模型。第二种叫"仅提供标准",不给任何具体反馈,只把评分的维度告诉教师模型,让它参照标准来回答。第三种叫"多选题式",让教练AI从9个预设的改进方向中选一个,比如"提升事实准确性"或者"加强创意表达",这样反馈信息量和打个1到10的分数差不多。第四种就是体验学习的默认方式:教练AI从评估过程中提炼出可迁移的通用策略,而不是针对这次回答的具体修改意见。

测试结果显示,默认的体验学习方式在专项评测(WildChat得分68.6)和通用能力评测(IFEval准确率68.8%)上都表现最好。完整评语和仅提供标准这两种方式虽然也提升了专项分数,但通用能力分数下降了——原因在于,评审性质的文字会让教师模型产生一种"批改习惯",AI在学习时连带着学进去了这种模式,在完全不同类型的任务上就会显得不对劲。多选题方式因为信息量太少,提升空间有限,和前面关于信息带宽的分析完全吻合。

此外,研究团队还发现,如果让教师模型随着训练进行而迭代更新——也就是每轮训练结束后,让当前的学生模型成为下一轮的教师——专项分数会进一步提升(从80.0到80.7),但通用能力会明显下降,原因是模型在专注训练某类任务时,慢慢"遗忘"了其他领域的能力。解决办法是在训练数据里混入一部分来自其他领域的普通提示,让模型时不时"复习"一下,这样就能在提升专项能力的同时,把通用能力的损失控制在可接受范围内(IFEval从74.9恢复到79.9)。

**六、一个小型玩具实验:用数学模型说明问题的本质**

为了更直观地展示"打分方式"和"分布式引导方式"在根本原理上的差异,研究团队还专门设计了一个简化的思想实验。

设想一个教练AI心目中有一个"理想分布",代表对每种回应方式的偏好程度,形状类似一座双峰山——有两个高峰,代表两种各有优势的好回答风格。现在,把这个连续的偏好分布压缩成5个等级的分数(类似打1到5分),就会发现一个问题:处于同一个分数档次的所有回答,在分数层面变得完全无法区分,哪怕实际上有些更靠近峰顶、有些更靠近谷底。AI在训练时只能学到一个"阶梯状"的近似分布——能大致区分好差,但摸不清楚微妙的偏好。

而如果直接用分布本身来引导AI——也就是体验学习的方式——AI学到的分布形状就能更接近那个双峰的真实形态,把细微的偏好差异也保留下来。对于像数学题这样只有对错之分的二值目标,两种方式效果相差无几;但对于涉及多个质量维度、好回答本身就有多种不同风格的开放任务,这种细节上的差距就会变得不可忽视。

**七、这项研究和其他方法有什么不同**

研究团队在论文里也花了篇幅梳理了这套方法和其他相关工作的区别,帮助我们理解它在整个研究版图中的位置。

把AI的评估反馈转化成文字形式来使用,这个想法本身并不是全新的。此前已经有研究者尝试让AI反思自己的错误、把批评意见存进外部记忆库,或者在强化学习中加入文字反馈等。但这些方法大多有一个共同的局限:最终的训练信号依然落在一个标量分数上,文字分析只是辅助手段,信息瓶颈并没有从根本上突破。

体验学习的核心区别在于,它完全绕过了分数这个环节。学习信号不是"你得了7分",而是"根据这次评估,以下是适用于类似任务的通用策略……",学生模型要学的是向一个被经验知识指导后的教师模型靠拢,而不是最大化某个具体分数。这在目标上是本质不同的:追求更高分会让AI学会讨好评分系统,而向教师分布靠拢则让AI学会更接近人类真实偏好的回答方式。

研究团队还强调,这套方法的另一个好处是:教练AI在训练结束后就不再需要了。经验知识已经内化进了学生模型的参数里,部署时不需要额外调用任何辅助模型,不影响运行效率。

**八、局限性与未来方向**

研究团队对于这项工作的边界保持着清醒的认识。体验学习解决的是"反馈信息带宽"问题,但它并不能解决"教练本身是否靠谱"的问题。如果教练AI本身存在偏见或者评估能力有限,这些问题通过更丰富的文字表达同样会传导给学生模型,只是传导方式变了。

此外,生成经验知识本身也是有成本的,教练AI需要处理更复杂的提示,生成更长的输出。好在研究团队的分析表明,相比于整个训练流程中采样回答、调用反馈模型的总成本,这部分额外开销相对较小。

未来可以探索的方向包括:如何让经验知识的提炼过程更精准、如何在更多类型的任务上验证效果,以及如何设计更好的迭代学习机制让AI随着经验积累不断进化。

说到底,这项研究传递的核心信息很朴素:教学不只是给学生打分,还要告诉他们为什么。把这个道理用到AI训练上,带来的是切实可测量的性能提升,以及对"死记硬背考试套路"这种投机行为的有效抑制。当AI的学习方式越来越接近人类从经验中成长的方式,它在面对新问题时也就更有可能给出真正有价值的回答,而不只是一个能让评分系统满意的答案。这对于那些依赖AI处理创意写作、咨询建议、个性化内容等复杂任务的普通用户来说,意味着AI助手的质量上限可以被真正拉高,而不只是在已有的水平上反复打转。有兴趣深入研究这套方法的读者,可以通过arXiv编号2607.18110查阅完整论文,研究团队也在aka.ms/el-code提供了代码实现。

Q&A

Q1:体验学习和传统强化学习在AI训练上有什么区别?

A:传统强化学习让AI的"评委"把所有评估结果压缩成一个数字分数,AI只根据这个分数来调整自己的行为。体验学习则让评委把评估过程中的分析提炼成可迁移的经验建议,AI通过学习被这些建议指导后的教师模型来提升自己。本质区别在于:前者追求更高分,容易学会"考试技巧";后者学的是通用策略,在没见过的新任务上表现更稳定。

Q2:体验学习中的"经验知识"具体长什么样?

A:经验知识是教练AI从评估一次具体回答中提炼出来的通用建议,通常是几条可以迁移到类似任务的策略性指导,比如"描述场景时要调动多种感官而不是堆砌形容词"或"每个限制说明后面都应该给出替代方案"。它不是针对那一次回答的具体修改意见,而是适用于同类任务的可复用规律,长度通常在几百词左右。

Q3:体验学习为什么能减少AI训练中的"奖励黑客"问题?

A:"奖励黑客"指AI学会迎合评分系统的偏好,而不是真正提升回答质量,就像学生专门背题型套路应付考试。体验学习完全绕过了分数环节,AI的优化目标是让自己的输出更接近被经验知识指导后的教师模型的分布,而不是最大化某个具体分数。没有了可以"钻空子"的数字目标,AI就更难通过表面的模式匹配来欺骗评分系统,学到的能力也因此更真实。