来源:市场资讯

(来源:机器之心)

打开网易新闻 查看精彩图片

  • 标题:Trust Region On-Policy Distillation

  • 文章地址:https://arxiv.org/abs/2606.01249

  • 项目地址:https://github.com/Xingrun-Xing2/TrOPD

GPT-6 等前沿大模型的能力仍在快速 Scaling,但随之攀升的推理成本,正在成为 AI 进一步规模化普及的关键障碍。当 AI 从云端走向手机、平板、智能家居等终端,模型不仅要 “足够聪明”,还必须塞进有限的内存和算力预算,并满足功耗、时延等严苛约束。

对于拥有数亿级终端设备的三星而言,这一矛盾更加直接:如何用更小的模型、更低的推理成本承载更多智能,让前沿 AI 能力进入更多终端,已经成为端侧智能继续 Scaling 的关键问题。端侧模型能否有效继承大模型的复杂推理能力,不仅决定 AI 能覆盖多少设备和应用场景,也直接影响智能服务的成本与用户体验。

On-Policy Distillation (OPD) 正是解决这一问题的重要技术路径。相比通过结果奖励驱动模型自主探索的 GRPO,OPD 利用教师大模型提供细粒度监督,让端侧模型直接学习更强模型的推理能力。然而,现有 OPD 面临一个关键瓶颈:当教师与学生模型能力差距较大时,监督信号可能失真,甚至导致训练不稳定。

针对这一问题,三星大模型团队联合牛津大学、北京大学提出基于信任域 OPD 方法(Trust Region On-Policy Distillation),通过识别教师 “可信” 的监督区域,让端侧模型更稳定、更有效地继承大模型能力,为前沿智能以更低成本走向数亿终端提供了一条新路径。

核心结论

当前关于 On-Policy Distillation(OPD)的研究,大多缺少统一 benchmark 下的公平对比:不同工作的训练步数、KL 散度估计方式各不相同,很难判断某一种改进是不是真的有效。这篇先把主流 OPD 方法拉到统一设定下系统测了一遍,由此发现了真正决定 OPD 训练成败的关键:

不是该用哪种散度公式(FKL、RKL 还是 JSD),而是教师能否对学生生成的每一个 token 给出可靠监督。一旦学生和教师的输出分布差得太远,监督信号本身就会失真,再精巧的散度公式也救不回来。

沿着这个发现,提出 TrOPD (Trust Region On-Policy Distillation):只在教师 “信得过” 的区域做常规的在策略学习,对教师 “看不懂” 的离群区域换一种更温和的监督,再用离策略引导主动把学生的生成拉向信任区域。在 Qwen3-SFT-1.7B 上,TrOPD 在数学(AIME 25)、代码(LiveCodeBench)、指令遵循(IFBench)、STEM(GPQA)四个基准上分别比原始 OPD 提升 +3.34、+4.00、+5.11、+6.18 分,全面超过 EOPD、REOPOLD 等现有方法。

打开网易新闻 查看精彩图片

图 1:在 Qwen3-SFT-1.7B 学生模型上,TrOPD(紫色)相较 OPD、REOPOLD 等基线在四个基准上的领先幅度。Qwen-1.7B 为官方的非开源 OPD 版本,仅作为参考。

问题:K1 估计器的两个优化瓶颈

要理解 OPD 为什么会训崩,得先看懂它现在是怎么给 “教师的分数” 打分的。

全词表 OPD 方法(如 GKD、speculative KD)在整个词表上计算 KL 散度,信号最完整,但显存开销是 On⋅k(n 为序列长度,k 为词表大小,常见 LLM 词表动辄十万级),推理模型动辄生成几千上万 token 的思维链,这个开销很快变得不可承受。

为了绕开这个瓶颈,Thinking Machines Lab 提出用 K1 估计器给出 KL 散度的无偏估计,不再对整个词表求和,只在学生实际采样到的那一个 token 上算一次:

打开网易新闻 查看精彩图片

这里 πS、πT 分别是学生和教师在当前 token 上给出的概率。单样本估计把显存开销从 On⋅k 压到了 On,代价是优化过程的稳定性,集中体现为两个具体的瓶颈。

瓶颈一:策略梯度离群点。一个 token 对总梯度的贡献大致是 “奖励 × 对数概率的梯度”:奖励

越大,说明教师越认可这个 token,更新幅度也越大。问题在于,一旦学生采样到的某个 token 教师给出的概率趋近于 0,奖励就会冲向负无穷:一次更新的方向可能被某个 “倒霉” 的离群 token 完全主导,数量级上压过成百上千个正常 token 的贡献总和。

这两个瓶颈说明:光是把 “全词表 KL” 换成省显存的 K1 估计器还不够,它解决了显存问题,却把 “教师监督是否可靠” 这个问题暴露得更彻底。那么,现有的改进思路解决了这个问题吗?

现状综述:主流方法都在改什么

面对这两个瓶颈,现有工作大致沿两条思路修补。

思路一:换散度公式。KL 不对称:RKL 的期望在学生分布上取,重点惩罚“学生有质量、教师没质量”的区域,表现为 mode-seeking——学生被牢牢约束在教师的主要分布上。围绕它有两种改法:一是弃用RKL,改在教师概率最高的 top-k 个词(受显存所限一般取 64)上求和计算 FKL;二是用 JSD 在混合分布上做对称折中(β 默认 0.5),GKD 等工作即属此类。

思路二:筛 token,不改公式。 与其修改散度估计,不如直接把 “不靠谱” 的 token 排除在训练之外,常见三种设定:受高熵 GRPO 方法的启发,只保留熵最高的前 20% token、其余置零;REOPOLD 保留全部 token 但给奖励设下限,把低于阈值 τ 的奖励抬到 τ,属于 “温和纠偏”;Token 掩码(Mask)更彻底,直接把超出阈值的奖励梯度清零,即 “完全无视”。

这些改法各自都讲得通,却从未在同一套教师、学生、训练步数和采样设置下被公平比较过 —— 哪条思路真的有用,只能靠实验说话。

诊断实验:先把 OPD 问题找出来

把上述方案统一放到相同的教师模型(Skywork-OR1-Math-7B)、学生模型(DeepSeek-Qwen2.5-1.5B)、训练配置下训了一遍,数学推理基准结果如下:

打开网易新闻 查看精彩图片

表 1:以 Skywork-OR1-Math-7B 为教师、在数学推理基准上对比各类 OPD 策略。单独使用 FKL 几乎训不动;裁剪或屏蔽离群奖励有明显提升;离群区域改用前向 KL 效果更好;TrOPD 综合最优。

三个现象,和上一节的理论推演对照着看,很能说明问题:

1. 单独用 top-k 估计的 FKL,训练几乎直接失败。这印证了 top-k 截断 FKL 从教师的概率角度进行估计,依然存在较大的偏差。

2. 按熵筛选 token,反而略微拖了后腿。 Entropy OPD 20% 平均分 46.13,比什么都不做的 OPD(RKL)基线 46.79 还低。教师在熵不高的 “普通” token 上同样能提供有效监督,只学高熵 token 反而丢掉了更多有效信号。

3. 奖励裁剪确实有效果,但依赖超参数。 Clip Outlier(47.86)和 Mask Outlier(47.72)都比 OPD 基线高出约 1 个点,说明 “抑制离群梯度” 方向是对的。但阈值 τ 需要人工固定设定,没办法随训练进程自适应。

三条现象放在一起,指向同一个结论:

换散度公式,或按熵筛选 token,都没有真正触及问题的根子。判断一个 token 的监督信号是否可靠,不能只看散度公式或熵这类和 “教师是否认可” 无关的指标,而应直接衡量教师和学生在这个 token 上的分歧程度本身。裁剪 / 屏蔽已经摸到了正确方向的边(用奖励大小去筛选),值得进一步探索。

核心方法:基于信任域的 OPD

问题出在离群 token 的梯度失真,TrOPD 的思路很直接:借鉴强化学习里的信任域策略优化(TRPO),只在教师信得过的区域做常规的在策略学习,离群区域换一套更保守的监督。

打开网易新闻 查看精彩图片

图 2:TrOPD 总览。学生生成的 token 按教师是否 “认可” 分为信任域和离群区域,分别使用不同的散度估计;同时引入离策略引导,让学生从教师给出的前缀续写。

给定信任域掩码 M(等于 1 表示这个 token 落在信任域内,等于 0 表示离群),单个 token 的训练目标写成:

打开网易新闻 查看精彩图片

也就是信任域内继续用原来的 K1 反向 KL,离群区域换成基于教师 top-k 词表的前向 KL。

怎么判定一个 token 是否落入信任域? 借用投机解码的思路,把学生看成 “草稿模型”、教师看成 “目标模型”,以下面这个比值作为 token 落入信任域的概率:比值越接近 1,说明教师越认可,该 token 就留在信任域内,继续吃常规的反向 KL 信号;比值越小则说明教师本就不认可,换成更保守的前向 KL 更合适,避免引入离群梯度。

这个设计在训练曲线上的效果非常直观:

打开网易新闻 查看精彩图片

图 3:相比原始 OPD 和 Clip Outlier,屏蔽离群点(Mask Outlier)训练过程中策略熵更高(探索能力保留更好)、梯度范数更低更稳(优化更平稳)。

OPD 和 Clip Outlier 的策略熵在训练开始后几十步内就从接近 1.0 断崖式下跌到 0.2~0.3,Mask Outlier 的熵则稳定在 0.5 左右;梯度范数走势一致,OPD 持续更高,Clip、Mask Outlier 很快收敛到接近 0。这说明 “裁剪 / 屏蔽能涨分” 的底层机制是减少了破坏性更新,TrOPD 的信任域机制则把这个 “临时补丁” 变成了有理论依据、能自适应的判据。

离群区域也别把信息全扔了。完全屏蔽离群 token 虽然稳,但可能丢掉有用的监督信号。TrOPD 从教师视角出发,给离群区域补一个前向 KL 目标:

是教师概率最高的 top-k 个词。只要学生在这些词上还留有一点概率,这一项就会产生梯度,推动学生朝教师最认可的词靠拢;若完全不沾边,会趋向无穷大,但实现里这一项随学生概率趋于 0 自动被抑制,不干扰信任域内的正常训练,只在 “还有救” 时出手。

再加一道离策略引导,主动把学生 “拉” 进信任域。前面的信任域划分本质上是 “事后诊断”:先让学生生成,再判断落不落在教师信得过的区域;若学生分布本身就和教师相去甚远,大量 token 一开始就会被划进离群区域。TrOPD 反过来在生成起点上做文章:学生的续写先接上教师生成的一段前缀,用前向 KL 做模仿学习,之后的才切回学生自己生成、继续走信任域机制:

打开网易新闻 查看精彩图片

续写接着教师语境往下写,后续 token 落入信任域的概率随之提高,不再是被动等离群 token 出现再补救,而是主动引导学生的探索方向。教师前缀长度 l 训练初期设为最大训练长度,之后按余弦调度退火到 0,学生独立生成比例逐步提高,直到完全变成纯粹的在策略生成,这样训练初期就避开了 “学生自由生成、信任域内所剩无几” 的高风险阶段,再逐步放手交给信任域机制自我调节。

把信任域内的反向 KL、离群区域的前向 KL、离策略引导的前向 KL 合到一起,就是 TrOPD 完整的目标函数:

打开网易新闻 查看精彩图片

实验结果

在单领域(仅数学)和多领域(数学 + 代码 + 科学)两种场景下,分别用 DeepSeek-R1-Distill-Qwen-1.5B 和 Qwen3-SFT-1.7B 作学生模型做了系统评测。

打开网易新闻 查看精彩图片

表 3:单领域中,TrOPD 相比 OPD 在数学推理上平均提升 +3.06 分,域外任务上提升 +2.63 分;相比同样做了离群点修正的 REOPOLD 仍高出 1.99~1.84 分。多领域下,TrOPD 相比 OPD 提升达 +4.62 分。

打开网易新闻 查看精彩图片

表 4:换成更强的 Qwen3-SFT-1.7B 学生模型和 Qwen3-Nemotron-4B 教师模型,多领域下 TrOPD 相比 OPD 平均提升 +3.44 分,AIME 2024 从 48.02 提升到 52.08,IFBench 从 37.07 提升到 42.18。

这些数字里,有两个规律值得多说两句。

第一,TrOPD 的提升不只发生在训练过的领域内。 单领域只用数学题训练,但额外评测了域外(OOD)任务:TrOPD 相比 OPD 在训练过的数学推理上平均提升 +3.06 分,在完全没训练过的代码生成和 STEM 任务上提升幅度反而更大,达到 +2.63 分。模型压根没在这些任务上做过在策略训练,这个提升只能来自更本质的原因:信任域机制让教师监督信号被更可靠地利用,这种优化质量的提升自然会泛化到其他任务。

第二,教师和学生差得越远的场景,TrOPD 的优势反而越大。 把同一个学生模型放到单领域和多领域(数学 + 代码 + 科学)两种设置下比较:OPD 基线平均分从单领域的 37.11 掉到多领域的 32.99,跌了 4.12 分,任务越杂越难顶住;而 TrOPD 从 40.63 掉到 37.61,只跌了 3.02 分,相对优势反而从 +3.52 分扩大到 +4.62 分。这与信任域机制的设计初衷一致:教师、学生分布差距越大,越需要一套能自适应处理离群点的机制。

结论与展望

TrOPD 的意义,在于把在 OPD 的关注点从散度形式的选择,转向监督信号本身的可靠性。信任域以教师与学生的分歧程度为判据,自适应调整学生模型的学习方式,为 OPD 建立了一套有理论依据的稳定机制。教师与学生的能力差距越大,这一机制的收益越为显著,而这正是端侧部署的常态:在受限的参数与算力预算下,仍要求小模型尽可能完整地承接大模型的推理能力。随着端侧智能向更多设备与场景延伸,进一步提升监督信号的可靠性,将持续决定端侧 AI 能力的上限。

作者信息

本文第一作者为邢兴润博士,现任三星大模型团队研究员。他博士毕业于中国科学院自动化研究所,曾在北京智源人工智能研究院等机构开展研究工作,长期专注于大模型强化学习、高效推理等方向。

本文通讯作者为唐业辉博士。公开资料显示,他现任三星大模型团队负责人、高级技术总监。作为全球规模最大的科技企业之一,三星拥有庞大的研发体系,而 “95 后” 的唐业辉已成为其最年轻的部门负责人,主导大模型训练及核心技术研发。他博士毕业于北京大学,曾入选 “天才少年” 计划,其研究成果在 Google Scholar 上累计引用超过 1.4 万次,并长期担任 NeurIPS、ICML、ICLR 等国际顶级 AI 会议领域主席(Area Chair)。