这项由南开大学、北京理工大学、浙江大学、中国科学院自动化研究所、哈里工业大学及中关村学院等多家机构联合开展的研究,以预印本形式发表于2026年7月,论文编号为arXiv:2607.17247,有兴趣深入了解的读者可通过该编号查询完整论文。
你有没有想过,那些能够帮你写代码、解数学题、回答各种刁钻问题的AI助手,究竟是怎么变得越来越聪明的?说穿了,它们的"进化"过程其实和人类学习没什么本质区别——要么自己反复练习、在错误中成长,要么找个更厉害的老师,跟着老师学新东西。然而,这两条路各有各的麻烦,就像一个学生,光靠自己刷题会遇到瓶颈,而一味照抄高手答案又学不到真本事。这篇论文提出的"蒸馏强化学习"(Distilled RL),正是为了解决这个两难困境而生的。
一、两条路,各有各的坑
要理解这项研究解决的问题,先得搞清楚AI模型目前主要用哪两种方式来"变聪明"。
第一种叫做强化学习(RL)。打个比方,这就像一个学生靠自己做题、对答案来提高成绩。AI每次给出一个答案,系统会告诉它"对了"或者"错了",然后AI根据这个反馈调整自己的思路。这种方法的好处是AI完全依靠自己的力量成长,不会被外界带偏;但坏处也很明显——它只知道最终结果对不对,却不知道中间哪一步出了问题。就好比你做了一道数学大题,老师只告诉你"算错了",但不指出是哪个步骤出了差错,你下次还是可能在同一个地方翻车。更关键的是,强化学习只能强化AI"本来就会的东西",对于那些AI从来没见过、完全不会的知识,单纯靠自我练习几乎没有用。
第二种叫做在线蒸馏(OPD)。这就像是让一个学生跟着大师学艺——不是照着大师留下的笔记背,而是实时观察大师如何解题,然后努力模仿大师的每一步思路。具体来说,AI学生自己先写一个答案,然后逐字逐句地和AI老师(通常是一个更大、更强的模型)做对比,拼命让自己的每个词都和老师选的词"口味相似"。这种方法的好处是反馈非常细致,每个词都有指导;坏处同样显而易见。当老师和学生本来就差不多时,学来学去也没多少新东西;而当老师和学生差异很大时,强行模仿反而适得其反——就像让一个刚学英语的人直接模仿莎士比亚的写法,只会越学越乱。
研究团队通过大量实验,清晰地观察到了这两个问题的具体表现。在训练曲线图上,在线蒸馏在训练开始阶段进步飞快,但很快就撞上了天花板,成绩开始停滞甚至下滑,尤其是在老师和学生来自不同"家族"(也就是结构和训练背景差异很大)的情况下,这种崩塌更加明显。强化学习则进步缓慢,但能持续爬升。把两者直接混合使用的方案,在训练后期同样出现了性能下滑,说明单纯叠加并不能解决根本问题。研究团队还特别验证了一件事:增加在线蒸馏时AI自己采样的次数,并不能改善瓶颈——把采样组数从1增加到4再增加到8,效果几乎没有变化。这说明问题的根源不在于"练得不够多",而在于这种无条件模仿大师的学习方式本身有缺陷。
二、新方法的核心思路:让老师成为"选择性顾问",而不是"必须照搬的权威"
既然两条路各有短板,研究团队的思路是:把老师的指导融入进强化学习的过程里,但不是让学生无条件地模仿老师,而是让老师在关键时刻提供精准的、有选择性的指导。这就是"蒸馏强化学习"(Distilled RL)的核心理念。
可以用一个学棋的比喻来理解整个框架。假设你在学围棋,你的师傅(老师模型)是个高段位选手。传统的在线蒸馏,就是让你每走一步棋,都要努力模仿师傅在同样情况下最可能走的那步,不管你走的这步棋最终是赢棋还是输棋。而传统的强化学习,只告诉你这盘棋最后赢了还是输了,至于哪步棋下对了哪步棋下错了,全靠自己猜。蒸馏强化学习则采用了一种更聪明的方式:它先让你按照自己的想法下棋,然后看这盘棋最终的走向;只有当这盘棋整体来看是"值得学习的好局"时,才参考师傅在每一步棋上的偏好,让你从师傅那里汲取更多智慧;而当这盘棋本来就是一场失败的烂棋时,就直接沿用原来强化学习的惩罚机制,不让师傅的偏好来干扰"这步棋要受到惩罚"的判断。
三、三个精妙的技术设计
这个框架的具体实现由三个环节组成,每个环节解决一个具体问题,三者合在一起才构成完整的蒸馏强化学习。
第一个环节叫"反向重要性采样"。在强化学习中,有一个常用的技巧叫重要性采样,它的作用是把"旧版AI选择的方案"的权重,调整成适合"当前版AI"的权重。蒸馏强化学习把这个方向反过来了:它计算的是老师模型和旧版学生模型对每一个词的"偏好差异比值"。具体来说,如果老师非常喜欢某个词(老师选这个词的概率远高于学生旧版本),这个词就会得到一个大于1的权重;反之,如果老师对某个词不太感冒,这个词就会得到一个小于1的权重。这个权重衡量的是"老师比学生旧版本更偏好这个词的程度"。为了防止这个比值出现极端情况(比如某个词老师极度偏爱但学生完全不用,导致比值爆炸性增大),设计中对这个比值做了截断处理,把它限制在一个合理的区间内,确保训练过程不会失控。
第二个环节叫"负样本重置"。这是整个方法中最精妙、也最关键的设计。回想一下前面下围棋的比喻:当学生自己走的棋整体上是"好棋"(也就是这次回答得比较好、整体评分为正)时,引入师傅的偏好来调整每一步棋的权重是有意义的——师傅偏爱的步骤得到强化,师傅不喜欢的步骤被相对削弱,从而在"好的大方向"下实现更精细的优化。但当学生走的棋整体上是"烂棋"(这次回答整体评分为负)时,情况就不同了。在强化学习中,"烂棋"中的每一步都应该受到惩罚,让AI知道"这么走是不对的"。如果这时候还引入师傅的偏好,就会出现一个荒谬的结果:师傅偏爱的步骤,在"烂棋"里反而会因为权重变大而受到更严重的惩罚,等于在逼着AI故意避开师傅的思路。这显然是错误的。负样本重置的解决方案非常直接:当一个回答整体评分为负时,直接把所有词的老师权重重置为1,也就是完全恢复到普通强化学习的状态,让原始的惩罚信号正常发挥作用,不让师傅的偏好在错误方向上"帮倒忙"。
第三个环节叫"序列级几何归一化"。这个设计解决的是一个更隐蔽的技术问题。AI生成一段文字时,是一个词一个词地往后写的,而整段文字的总概率,是每个词的概率相乘得到的。老师模型和学生模型毕竟是两个不同的模型,它们对整段文字的"总体喜好程度"在数量级上就可能有很大差异。如果把所有词的老师偏好比值直接相乘,结果可能非常小(远小于1),这样就相当于把好的回答整体"压缩"了,让训练信号整体变弱,学不到什么东西。几何归一化的做法是,对一个回答里所有词的老师偏好比值做一次"整体校正"——把每个词的比值除以这个回答里所有词比值的几何平均数,让整体相乘结果等于1。这样一来,老师的指导就不是在整体上放大或缩小这个回答的重要性,而是在回答内部重新分配学习的侧重点:老师更偏爱的词得到更多关注,老师不太偏爱的词得到相对少一些的关注,而整体的学习力度保持不变。
四、一个优雅的"验证实验":用温度来测试知识传递
光靠最终的评分表来说明效果还不够直观,研究团队设计了一个非常巧妙的案例研究来直接展示蒸馏强化学习是否真的能传递知识。
这个实验用了一个叫"熵"的概念来做测试。在AI语言模型的语境里,熵可以理解为"AI在选词时的不确定性"或者"AI选词的随机程度"——熵高说明AI给很多候选词都分配了差不多的概率,不太确定选哪个;熵低则说明AI非常笃定地认为某个词最合适。通过控制温度参数(一个影响AI选词随机性的数值),可以人为地让一个模型变得"更犹豫"(高温度、高熵)或者"更果断"(低温度、低熵)。
实验的巧妙之处在于,研究团队不用一个更大的外部模型当老师,而是用学生模型自身当老师——但给了它一个会随时切换的温度控制规则:当学生当前的熵超过0.5时,老师就切换到低温度(0.8),告诉学生"你现在太犹豫了,要果断一点";当学生的熵低于0.5时,老师就切换到高温度(1.2),告诉学生"你现在太死板了,要灵活一点"。
如果蒸馏强化学习真的能传递老师的分布特征,学生的熵就应该在0.5附近来回振荡,跟着老师的温度信号走。实验结果清晰地显示,学生的熵确实迅速向0.5靠拢,然后在这个目标区域附近持续振荡——老师降温时学生熵下降,老师升温时学生熵上升,整个系统像一个精准的恒温器。这个实验直接证明了蒸馏强化学习能够把老师分布的特征性质传递给学生,而这种传递是原始强化学习完全做不到的,因为原始强化学习的信号只有最终答案对不对,完全不包含任何关于分布特征的信息。
当去掉"负样本重置"这个环节再做一遍同样的实验时,学生的熵就完全无法跟随老师的温度信号,始终维持在一个远低于目标的水平。这个对比实验非常直观地说明了负样本重置对于知识传递的关键作用——没有它,在负样本上反方向施加的老师偏好权重会抵消乃至压制正样本上的正确引导。
五、实验结果:在各种难度的考场上都更胜一筹
研究团队在多个评测维度上验证了蒸馏强化学习的效果,对比对象包括三个基准:单独使用在线蒸馏(OPD)、单独使用强化学习(RL,具体采用GRPO算法)、以及两者直接相加混合使用(OPD+RL)。测试的学生模型包括规模为15亿参数的DeepSeek-R1-Distill-Qwen-1.5B(简称DSQW-1.5B)、规模为17亿参数的Qwen3-1.7B以及规模为40亿参数的Qwen3-4B,老师模型统一使用规模为80亿参数的Qwen3-8B-GRPO。训练数据集使用DAPO-17K,共训练160步。
在最难的测试场景中,表现的差距最为显著。DSQW-1.5B和Qwen3-8B-GRPO之间不仅参数规模差距悬殊,而且两者来自完全不同的模型"家族"(一个是DeepSeek系列,一个是Qwen系列),推理风格和内部结构都有很大差异,这被称为"跨家族蒸馏"场景。在这个场景下,在线蒸馏虽然比不训练要好,但比单纯用强化学习还差,说明硬性模仿在家族差异很大时根本行不通。把两者混合使用也没有帮助,后期同样出现性能下滑。蒸馏强化学习则实现了最大幅度的提升,把DSQW-1.5B的综合成绩从31.70分提升到了40.00分,比在线蒸馏高出4.73分,比纯强化学习高出3.14分。
在Qwen3-4B这个"同家族"场景下,整体成绩从46.33分提升到了58.96分,比在线蒸馏高出2.99分,比纯强化学习高出1.56分。Qwen3-1.7B同样实现了稳定的全面领先。训练过程中的动态曲线也清楚地显示,蒸馏强化学习的奖励值始终保持在最高水平,策略的随机性(熵)保持在一个适中且稳定的区间,既不会因为过于随机而难以收敛,也不会因为过于保守而失去探索能力,回答长度也保持稳定,没有出现"越回答越短"或者"越回答越啰嗦"的异常现象。
在知识类测评(MMLU-Pro和SuperGPQA)上,蒸馏强化学习同样保持了竞争力,说明这种训练方法没有让AI"只会解数学题",而是在提升推理能力的同时保留了广博的通识知识。在Pass@16评测(也就是同一道题让AI回答16次,看能不能至少有一次答对)上,蒸馏强化学习同样表现最佳,说明它不仅提高了AI最常给出的那个答案的质量,还拓宽了AI整体的答题能力分布。
六、去掉某个环节会发生什么
研究团队还做了消融实验,分别去掉负样本重置和序列级几何归一化,来验证每个设计的必要性。
去掉负样本重置的后果是最严重的。在Qwen3-4B上,综合成绩平均下降了8.81分;在DSQW-1.5B上,平均下降了6.39分。这个下降幅度甚至比完全不用老师指导还要差,直接说明了在错误回答上盲目引入老师偏好,不仅没有帮助,反而是有害的。前面提到的熵控制实验里,去掉这个环节后学生完全无法跟随老师的温度指令,也从另一个角度印证了这一点。
去掉序列级几何归一化的后果相对温和一些,但同样稳定地导致性能下降,在两个学生模型上分别下降了1.24分和1.47分。这说明即使方向对了(只在正样本上引入老师权重),如果不做整体校正,老师和学生之间的概率尺度差异还是会系统性地压制学习信号,让训练效果打折扣。
七、这个方法还有什么局限性
研究团队在论文中也坦诚地指出了这个方法目前的不足之处。最核心的限制在于,整个训练过程中老师只被用来评估学生自己写出来的答案,而不是被要求自己先写出正确答案来。这意味着训练过程无法直接判断老师对某道题是否真的会做。虽然负样本重置机制在一定程度上缓解了这个问题(因为在学生自己也答错的题目上,老师权重会被归零),但仍然存在一个隐患:在那些学生答对了、但老师其实并不比学生强的题目上,老师的词偏好权重可能反而是一种干扰,把学生往错误的方向引导。随着训练推进,学生的能力在某些领域可能超过了固定不动的老师,这时候老师的"意见"就会变得不那么可靠。未来的改进方向可以考虑给老师设置一个"能力评估"机制,比如偶尔让老师也完整地回答一道题来检验它是否真的会做,或者根据老师给出建议的一致性和置信度,动态调整对老师建议的参考程度。
说到底,这项研究解决的问题可以用最简单的话来描述:以前的AI训练方法,要么让AI只靠自己摸索(进步慢、遇到瓶颈),要么让AI无条件模仿老师(容易过拟合、跨家族时适得其反),而蒸馏强化学习找到了一条中间道路——让老师在合适的时机、以合适的方式、选择性地给出精细指导,而不是当一个学生必须全盘照搬的权威。实验结果表明这条路走对了,尤其是在老师和学生差异最大的情况下,优势最为明显。对于普通用户而言,这意味着未来的AI助手有望在更少的计算资源消耗下达到更高的推理能力,特别是那些规模较小、可以在普通设备上运行的AI模型,也能借助更大模型的知识来弥补自身能力的不足,这对于AI技术的普惠化有着直接的推动意义。有兴趣深入了解技术细节的读者,可以通过arXiv编号2607.17247查阅完整论文。
Q&A
Q1:蒸馏强化学习和传统知识蒸馏有什么本质区别?
A:传统知识蒸馏让学生模型无条件地在每一步都模仿老师的词概率分布,不管学生自己的回答好不好。蒸馏强化学习只在学生回答整体较好的情况下才参考老师的逐词偏好,在学生回答较差的情况下会恢复为普通强化学习的惩罚机制,本质上是把老师的指导变成了"有条件的精细辅助"而不是"无条件的全面模仿"。
Q2:蒸馏强化学习为什么在跨家族蒸馏里效果特别明显?
A:跨家族指的是老师模型和学生模型来自完全不同的训练背景和架构系列,二者的用词偏好和推理风格差异很大。传统在线蒸馏在这种情况下因为强行模仿而导致性能下降,而蒸馏强化学习通过负样本重置和几何归一化,避免了对差异化分布的盲目跟随,只保留了相对有用的老师偏好信号,因此在差异最大的场景下反而收益最显著。
Q3:负样本重置去掉之后为什么成绩会比不用老师还差?
A:当一个回答整体是错误的,强化学习本应对其中每个词施加惩罚。但如果此时加入老师偏好权重,老师比较喜欢的词反而会因为权重变大而受到更重的惩罚,等于在错误轨迹上把老师偏好当成了"需要避免"的行为来训练,方向完全反了。这不仅浪费了老师的参考价值,还会主动把学生推向与老师相反的方向,造成比不引入老师还要差的结果。
热门跟贴