打开网易新闻 查看精彩图片

这项由清华大学牵头、联合浙江大学、香港中文大学、南洋理工大学和同济大学共同完成的研究,发表于2026年7月,论文编号为arXiv:2607.14777,有兴趣深入了解的读者可通过该编号查询完整论文。

**一段旅途,一本日记,一个会反思的学生**

每个人大概都有过这样的经历:考完一场糟糕的考试,拿到卷子一看,原来是在某个关键步骤上犯了可以避免的错误。如果能在下次考试前把这个教训总结成一句话,贴在课桌上,下次就不会再犯了。

现在的AI智能体(可以理解为能自主完成任务的"机器人助手")训练过程,恰恰缺少这种"总结贴纸"的机制。它们在完成任务时,只能知道最终结果是成功还是失败,却无法知道是哪一步走错了、哪一步做对了。这就像教一个学生做题,每次只告诉他"全对"或"全错",而不指出具体哪道题有问题。

清华大学等机构的研究团队提出了一个名为SEED(SElf-Evolving On-Policy Distillation,自我进化的在策略蒸馏)的训练框架,专门用来解决这个问题。它的核心思路是:让AI智能体在每次完成任务之后,像一个有经验的教练一样,主动回顾整段经历,提炼出"下次该怎么做"的具体经验,然后把这个经验悄悄内化到自己的决策能力里——不需要把经验写在小抄上带进考场,而是让它真正变成自己的知识。

这个研究的发现是:这种方式让AI智能体的任务成功率大幅提升,训练效率更高,而且在没见过的新场景里表现也更稳定。在三个不同类型的测试环境中,SEED均超越了当时最先进的对比方法,成为表现最强的框架。

**一、强化学习的困境:只告诉你"赢了"还是"输了"**

理解SEED解决的问题,需要先了解AI智能体是如何训练的。

目前训练AI"做事"的主流方法叫做强化学习。可以把它类比成训练一只宠物:每次它做出正确行为,就给它一块饼干作为奖励;做出错误行为,就不给。经过大量的尝试和反馈,宠物逐渐学会了怎么做能得到饼干。

AI智能体的训练也是这样:它不断尝试完成任务,任务结束后根据结果获得一个分数。如果完成得好,分数高;完成得差,分数低。这个分数叫做"奖励"。然后,训练系统根据这个奖励来调整AI的决策方式,使它下次更可能做出高分的行为。

但这里有一个根本性的问题:奖励是在整个任务结束之后才给出的,而完成一个复杂任务往往需要做出几十甚至上百个决策。问题在于,最终那个"成功"或者"失败"的结果,并不能告诉AI是哪一步做得好、哪一步做得差。一个成功的任务里,可能包含几个其实很低效的决策;一个失败的任务里,也可能包含几个其实非常聪明的子步骤。

研究团队把这个现象叫做"监督缺口"——任务层面的结果与每个具体决策之间,存在着一条巨大的鸿沟。奖励信号太粗糙,太笼统,无法精确地告诉AI每一步决策到底该不该做。

换句话说,这就好像一个厨师做了一道菜,食客只说"不好吃",但没有指出是盐放多了、火候太大还是食材新鲜度不够。厨师只能靠猜来改进,效率极低。

在长时间、多步骤的复杂任务中,这个问题尤其严重。AI可能需要依次完成信息收集、工具调用、结果验证等一系列操作,每个操作都有正确和错误的做法,但粗粒度的最终奖励根本无法区分它们。

**二、事后诸葛亮的价值:任务结束后,宝贵的信息才浮现**

研究团队注意到一个被长期忽视的现象:任务结束之后,整段经历中其实隐藏着大量有用的信息,这些信息在任务过程中是看不到的。

以完成任务失败为例。失败之后,回头看整个过程,可以清晰地看出:在哪一步做了错误判断、为什么会失败、以后遇到类似情况该避免什么。以完成任务成功为例,同样地,成功之后,可以总结出:是哪个关键步骤起了决定性作用、整体策略的核心是什么、这种方法以后还能用在哪里。

这种在事情结束之后才能获得的知识,研究团队称之为"后见之明"(hindsight)。这个概念来自心理学和强化学习领域:人在事后总能比事前看得更清楚。

然而,过去的AI训练方法对这种后见之明的利用非常有限。通常的做法是把它存储在一个外部的"记忆库"里,或者作为推理时给AI看的额外提示,但这种做法有两个明显的缺点。

第一,这些经验是静态的。随着AI越来越强、遇到的情况越来越多样,旧的经验库可能变得过时,不再适合新的状况。第二,这些经验在部署时需要额外提供,让AI在实际使用时变得更复杂、更依赖外部辅助。

SEED的核心创新,正是对这两个缺点的正面回应。

**三、SEED的核心机制:让AI同时扮演运动员和教练**

SEED的比喻可以这样理解:把AI智能体想象成一个既是运动员又是教练的人。作为运动员,它上场比赛、完成任务;比赛结束之后,它立刻换上教练的帽子,回顾刚才那场比赛,总结出具体的战术心得;然后,这个心得被直接内化进运动员自己的肌肉记忆里,下次上场就自然而然地更聪明了。

更关键的是,随着这个人越来越强,他作为教练的眼光也在提高。更高水平的比赛经历,产生了更高质量的复盘分析,反过来又推动运动员水平进一步提升。两种角色的能力协同进化,形成了一个良性循环。

在技术层面,SEED分为两个训练阶段。

第一个阶段叫做"后见技能监督微调"(Hindsight Skill SFT)。这个阶段的目标是赋予AI分析完整任务历史、生成有用经验总结的基础能力。做法是:先用一个初始的AI模型去大量完成任务,把所有完成的任务记录下来;然后用一个外部的高水平分析工具(在实验中使用了GLM-5.2这个大型语言模型)来分析这些任务记录,提取出"技能"——也就是描述"什么情况下该怎么做"或"什么情况下要避免什么"的自然语言总结;最后,用这些任务记录和对应的技能总结来训练AI,让它学会如何分析自己的经历。

这个阶段产生的是一个有了初步"反思能力"的AI模型。它不仅能完成任务,还能在任务结束后说出一段有用的经验总结。

第二个阶段叫做"自我进化的在策略蒸馏"(Self-Evolving On-Policy Distillation)。这是SEED的核心阶段,也是最有创意的部分。

在这个阶段,AI同时扮演两个角色:一方面作为"演员"去完成任务,另一方面作为"分析师"来分析自己刚刚完成的任务。两个角色共用同一个模型——同一套神经网络参数。每次训练更新之后,这套参数就同步升级,使得演员和分析师的能力同时提升。

**四、技能如何转化为精准的学习信号**

理解了大框架,再来看SEED是如何把"经验总结"转化为精确的训练信号的,这是整个系统最精妙的工程部分。

任务完成后,AI分析师生成了一段经验技能,比如"下次遇到类似情况,应该先检查目标物品的状态再移动,而不是直接去目标位置"。

现在,训练系统要把这个技能的价值"蒸馏"进AI的决策层面。做法是这样的:对于同一段任务经历,系统分别在两种情况下评估AI的每一步决策。第一种情况,AI不知道那段经验总结,只看任务过程中的普通信息;第二种情况,AI额外知道那段经验总结,在这个"开了天眼"的情况下再看同样的决策。

两种情况下,AI对"该做什么"的判断概率会有所不同。如果某个决策在"知道经验总结"之后概率明显更高,说明这个决策是经验总结所认可的好决策;如果概率没变甚至更低,说明经验总结对这个决策没有特别的支持。

这个概率差异,就成了精确到每一步、每一个词的学习信号。AI会被引导去提升那些被经验总结支持的决策的概率,同时不去强迫它提升经验总结不支持的决策。整个过程有一个"置信度门控"机制——只有当经验总结对某个决策的支持程度足够强时,才会给出强度较大的学习信号,避免噪音干扰。

更重要的是,这个学习信号和传统的结果奖励信号被同时使用。两者联合优化:结果奖励告诉AI任务整体上成不成功,而经验技能蒸馏信号告诉AI每一步决策具体该怎么做。两者互补,形成了更全面的学习指导。

训练结束之后,部署AI的时候,不需要再提供任何经验总结。AI已经把这些知识内化了,就像一个掌握了烹饪技巧的厨师,不需要再看菜谱,因为方法已经融入了他的肌肉记忆。

**五、三种不同类型的考场,SEED全部通过了**

研究团队在三类差异很大的任务环境中测试了SEED,以验证它不只是在某一种特定场景下好用。

第一类是ALFWorld,一个文字版的"虚拟家务助手"任务。AI在一个虚拟房间里,需要根据文字描述的环境,完成"清洁某个物品放到某处"、"把两本书放到床上"这类家务任务,总共有六种类型的家务。整个过程可能需要十几步到三十步,每步都要选择正确的行动。

第二类是WebShop,一个模拟电商平台的购物任务。AI需要根据用户的购物需求(比如"找一件绿色、价格低于40美元的浴室配件"),在一个搜索结果页面上逐步搜索、点击、选择颜色和尺码,最终完成购买。这测试的是AI在网络界面上的导航能力。

第三类是Search-based QA,一个需要联网查资料来回答问题的任务。AI必须先决定搜索什么,看完搜索结果后决定要不要再搜索,经过几轮收集信息后给出答案。这测试的是信息收集和推理能力,共用了七个不同的问答数据集。

针对这三类任务,研究团队设置了丰富的对比组。其中包括什么都不做只用基础AI的"原版",只在测试时给AI看技能提示的"技能提示"方法,只用结果奖励训练的GRPO,以及多种不同的知识蒸馏和技能学习方法,如OPSD、Skill-SD、RLSD、SDAR等。

在所有三个任务环境中,SEED在使用Qwen2.5-3B-Instruct这个3B参数规模的模型时,ALFWorld平均成功率达到91.8%,比纯结果奖励方法GRPO的75.0%高出近17个百分点,比当时最好的对比方法SDAR的84.4%高出7.4个百分点。在Search-based QA上,SEED达到45.7%的平均准确率,比GRPO的36.4%提升了超过9个百分点,也超过了所有对比方法。在WebShop上,SEED的成功率达到78.9%,同样超越所有对比组。

换到7B参数规模的更大模型Qwen2.5-7B-Instruct,SEED在ALFWorld上达到96.1%的平均成功率,基本上接近满分。在WebShop上,成功率达到78.1%。在Search-based QA上,平均准确率达到48.6%。同样超越所有对比方法。

在更轻量的Qwen3-1.7B-Instruct模型上,SEED的优势更加显著,在ALFWorld上的平均成功率达到92.0%,远超同条件下其他所有方法,其中GRPO只有46.1%,最好的对比方法SDAR也只有53.9%。

**六、越练越聪明:自我进化的真正含义**

从训练过程的动态数据来看,SEED的优越性不只体现在最终成绩上,更体现在学习速度上。

用ALFWorld的训练曲线来说明:在训练了40步的时候,SEED的任务成功率已经接近57%,而GRPO在同一时刻只有大约35%。这个差距在整个训练过程中持续存在,并没有随着训练推进而消失。这说明SEED不是靠训练更久来"堆"出好成绩,而是在每一轮训练中就能学到更有价值的东西。

另一个有意思的指标是每次任务的平均步数。SEED训练出来的AI完成任务所需的步数从约28步降低到约13步,而GRPO只降低到约16步。步数减少意味着AI找到了更直接、更有效的解决路径,而不是在环境里漫无目的地试错。更少的步数配合更高的成功率,说明AI是真的学会了高效的策略,而不是靠延长探索来碰运气。

研究团队还专门测试了数据效率。他们分别用20%、40%、60%、80%和100%的训练数据来训练SEED和GRPO,然后比较成绩。结果发现,只用60%训练数据的SEED(成功率80.7%),就已经超过了用全部训练数据的GRPO(成功率75.0%)。换句话说,SEED能从更少的任务经历中提取出更多的有效知识。在WebShop上同样如此,使用80%数据的SEED(成功率75.0%),超过了使用100%数据的GRPO(成功率63.3%)。

**七、见过的和没见过的,都能应对**

一个强大训练方法的重要标志,是学到的能力不只对训练时见过的情况有效,还能迁移到全新的场景。

研究团队专门用一批AI从未接触过的任务来测试泛化能力。在ALFWorld的"未见场景"测试集上,SEED训练的3B模型平均成功率达到86.2%,而GRPO训练的模型只有70.9%,差距超过15个百分点。在六个家务类型中,SEED在五个上都超过了GRPO,其中"加热"类任务的提升最为惊人,达到了35个百分点(从59.3%提升到94.3%),"寻找"类任务提升18.3个百分点,"拾取"类任务提升16.5个百分点。

这意味着SEED帮助AI学到的不是死记硬背的固定流程,而是可以灵活应用的一般性原则。就像一个真正学会了"整理收纳"方法论的人,不管是整理卧室还是整理办公室,都能有效地找到合适的解决方案。

**八、SEED内部拆解:哪个部件最关键**

为了弄清楚SEED为什么有效,研究团队做了消融实验——也就是把系统的各个部件一个个拆掉,看成绩下降多少。

第一个实验:去掉第一阶段的"后见技能监督微调",直接进入第二阶段的强化学习训练。结果ALFWorld平均成功率从91.8%下降到86.0%,减少了5.8个百分点。这说明,在强化学习开始之前,先让AI掌握"分析经历"的基础能力,是非常重要的。没有这个基础,后续的自我进化训练效果会打折扣。

第二个实验:去掉第二阶段的自我进化迭代机制,只做一次技能蒸馏然后就固定住。结果成功率从91.8%下降到87.0%,减少了4.8个百分点。这证明仅靠最初那一轮技能学习是不够的,需要随着AI能力的提升,持续更新经验总结,才能保持监督信号与当前AI行为的匹配。

第三个实验:不使用当前AI自己生成的技能,改用从一个静态离线数据库里检索的固定技能。结果是最大的一次下降,从91.8%降到84.4%,减少了7.4个百分点。这是三个实验中影响最大的。这非常直接地说明:经验总结必须来自当前AI自身的经历,针对它当前的行为模式和失败模式,才是最有价值的。别人的经验或者过时的经验,效果要差得多。

**九、不只是文字任务:多模态场景同样有效**

为了测试SEED是否只在文字类任务上有效,研究团队还在两个需要"看图"的视觉任务上做了测试,使用了能处理图像的Qwen2.5-VL-3B-Instruct模型。

第一个视觉任务是Sokoban,一个经典的箱子推移益智游戏,在6×6的网格地图上,AI需要观察当前图像,判断玩家、箱子、墙壁和目标位置,然后决定推哪个方向。因为箱子只能推不能拉,一步错误可能导致整盘无法完成,需要相当的前瞻规划能力。

第二个视觉任务是EZPoints,AI需要看两张扑克牌的图像,在每一步选择一个牌的数值或一个算术运算符,拼凑出等于12的算式,且每张牌只能用一次。这需要精确的视觉识别加上数学推理。

SEED在Sokoban上的成功率达到82.0%,比GRPO的67.1%高出约15个百分点;在EZPoints上更是达到100%的完美成绩,比GRPO的86.9%高出13.1个百分点。两项任务的平均成功率从77.0%提升到91.0%。这表明,SEED的后见知识提炼机制不依赖特定的任务类型,同样适用于需要处理图像信息的决策任务。

**十、原论文的理论推导:为什么这样做是对的**

除了大量实验,研究团队还在论文中给出了三个理论命题,从数学层面解释SEED为什么能有效工作。

第一个命题说明,SEED的知识蒸馏目标函数,实际上等价于让AI去模仿一个"经技能支持的加权版自己"——那些被经验总结支持的决策,会被赋予更高的权重;那些没有被经验总结支持的决策,权重相对更低。这种加权并不是平等对待所有决策,而是让AI更努力地向经验验证的正确方向学习。同时,这个命题也从数学上证明了为什么必须用当前AI自己的任务数据:如果用旧数据,数据分布的偏差会直接转化为学习方向的偏差。

第二个命题证明,即使在最极端的情况下——整个训练批次里,所有任务的结果都一样(全都成功或全都失败)——SEED的技能蒸馏信号依然有效。在这种情况下,传统的结果奖励信号完全变成了零,对训练没有任何帮助。但只要经验总结对不同决策的支持程度存在差异,SEED就能提供有意义的学习信号,区分好的决策和差的决策。这正是"密集信号"超越"稀疏奖励"的关键所在。

第三个命题量化了"过时分析师"的危害。当负责生成经验总结的分析师跟不上AI能力的提升时,生成的技能可能已经不适用于当前AI的行为模式,导致学习信号出现偏差。命题在数学上证明,这种偏差与分析师参数的新旧程度直接相关。SEED通过每轮更新都同步刷新分析师(它和演员共用同一个参数),把这种偏差从根本上消除了。

说到底,SEED做的事情其实非常直觉:让AI在每次任务之后认真复盘,把复盘的心得真正变成自己的能力,而不是放进一个再也不看的备忘录里。这个看似简单的想法,需要相当精巧的工程设计才能实现——既要让复盘及时跟上AI能力的成长,又要把自然语言形式的经验总结转换成精确的数学学习信号,还要避免自我强化错误认知的风险。

从实验结果来看,这套设计是成功的。SEED在文字任务和视觉任务、在小模型和大模型、在已见场景和未见场景上,都展现出了稳定的优势。对于普通人而言,这项研究可能最终意味着:未来的AI助手在帮你完成长期复杂任务时,会比今天的助手更有条理、更少走弯路,也更懂得从失败中调整策略。就像一个真正经验丰富的助手,而不是一个只会机械执行指令、每次失败都茫然无措的初学者。

一个值得思考的问题是:如果AI能从自己的失败中总结经验并内化,那么随着时间推移,它总结经验的能力和决策的能力是否会同步达到我们难以预判的高度?这个问题,或许正是这类研究最值得持续关注的深层议题。

如有兴趣进一步探索,可通过arXiv:2607.14777查阅原论文全文。

Q&A

Q1:SEED框架和普通的强化学习方法有什么本质区别?

A:普通强化学习只告诉AI整个任务成不成功,无法指导每一步决策。SEED在任务结束后让AI主动回顾经历,生成具体的经验总结,再把这些经验转化为精确到每一步决策的学习信号,相当于把任务级别的粗糙反馈变成了步骤级别的精准指导。

Q2:SEED训练出来的AI在实际使用时需要额外提供经验技能吗?

A:不需要。SEED的设计目标就是让AI把经验知识完全内化到自身参数里,训练结束后部署使用时,AI只依靠正常的任务信息就能做出决策,不依赖任何外部技能库或额外提示,部署复杂度和普通AI完全一样。

Q3:SEED框架中分析师和演员共用同一个模型有什么好处?

A:共用同一个模型使得两个角色的能力始终保持同步更新。每次训练迭代后,演员的决策能力和分析师的反思能力同时提升,确保经验总结始终针对当前AI的行为模式和失败模式,避免用过时的分析方法来指导已经更强的AI,这是SEED实现"自我进化"的关键机制。