一条包含4000个token的推理轨迹,只保留其中1个token的梯度信号参与参数更新,其余全部屏蔽。按常理,这种训练应该直接崩溃。亚马逊和杜克大学的一项最新研究却给出了相反的结果:训练不但没失败,学生模型的推理能力反而显著提升。

这项研究挑战的是一个被默认接受的假设——大模型后训练中,密集的token-level信号真的是必要的吗?论文标题为《Extremely Sparse Supervision Incentivizes Reasoning Ability》。

打开网易新闻 查看精彩图片

一次后训练,上亿个梯度信号

后训练是提升大模型推理能力的关键环节,一次后训练至少包含上亿个token的梯度信号。以数学推理为例,模型的一条rollout通常包含几千个token。

研究团队选取的切入点是On-Policy Distillation(OPD,在线策略蒸馏)。这一范式近期在业界和学术界备受关注,在前沿大模型训练中已成为提升模型能力和实现高效能力迁移的重要路径。OPD天然带有密集的token-level监督信号:学生模型生成推理轨迹,教师模型对轨迹中每一个token提供反馈。

这种密集监督一直被视为OPD成功的重要特点,但也让理解其内在机制变得困难。研究团队于是做了一个极端实验:对学生模型生成的每一条rollout,仅随机保留一个token处的梯度参与参数更新,mask掉其他所有token处的信号。

换算下来,如果一条rollout包含4000个token,只有0.025%的token得到了教师模型的监督信号。

9组配置,结果一致

研究团队基于Qwen3系列构造了9组不同的教师—学生配置,涵盖三种情况:

  • 小参数量学生模型蒸馏大参数量教师模型
  • 同等规模的教师模型和学生模型
  • 大参数量学生模型蒸馏小参数量教师模型

不同设置代表了教师模型与学生模型之间不同程度的表征差异。在所有组合中,随机监督一个token,都能一致地观察到学生模型推理性能的提升。

那么,这种提升能否进一步扩大?这涉及监督信号的选择。在OPD中,每一个token的监督信号代表教师模型和学生模型在该token处的分歧度。研究团队选择保留每一条rollout中分歧最大的token。

结果显示,仅仅一到两个token的监督信号,可以匹配甚至超过全信号训练。在Qwen3-8B学生模型与Qwen3-4B-Instruct-2507教师模型的组合中,监督一个或两个token得到的学生模型不仅优于全信号训练的结果,甚至超过了教师模型本身。

另一个观察同样值得注意:标准OPD的目标是缩小学生模型与教师模型输出分布之间的差异,但在极端稀疏监督下,推理性能最强的学生模型,其输出分布与教师模型之间的差异不仅没有缩小,反而可能进一步增大。这暗示学生并非单纯通过模仿教师模型获得推理性能的提升。

跨任务、跨模型、跨范式的验证

为了验证这一现象的泛化性,研究团队将实验拓展到了三个方向:代码推理任务、Llama系列模型,以及基于Proximal Policy Optimization(PPO)的Reinforcement Learning with Verifiable Reward(RLVR)。

在这些场景下,实验结果均展现了同样的现象:极端稀疏的监督信号足以非常有效地提升模型的推理能力。

研究团队还通过消融试验得到了一些结论。模型推理性能的提升与监督信号的稠密程度并非单调关系:随着受监督token的数量逐渐减少,模型推理性能起初会有所下降,但随后又会恢复;当监督变得极端稀疏时,性能甚至可以超过全信号训练。不过,当监督进一步稀疏到一定程度后,学习信号最终会变得不足,无法再带来有意义的推理性能提升。

在OPD实验中,当学生模型具有足够的表征能力,带正奖励的token可以更好地激发学生的推理能力;而当学生模型表征能力弱于教师模型时,带负奖励的token取得更好的训练效果。

极端稀疏监督也带来了更加稀疏的神经网络参数更新:万分之一的监督信号仅仅更新了10%的网络参数,即可取得大幅的推理性能提升。

这项工作给出了一个值得关注的数据点:一次成功的后训练,可能只需要利用几千个token处的梯度。在这一尺度下,研究者可以直接观察被激活token所承载的语义信息,以及它们对学习动力学的影响。

为什么一个token就够了

为什么一个token的监督信号就能如此有效?这仍然是一个开放的问题。

研究团队给出了一个类比:极端稀疏监督更像是人类的自然学习过程。当人们带着一定先验知识和基础能力去学习一项复杂任务时,往往并不需要细粒度的反馈,少量但关键的纠正信号就可能显著改变后续的行为与策略。

类似地,一个经过预训练、SFT和RL的大模型本身已经具备了一定的推理能力;当进一步对其进行后训练时,可能并不需要覆盖每一个token的密集监督,少量但关键的学习信号便足以引导模型进一步调整,并带来显著的推理性能提升。

该工作由杜克大学博士生Zhishuai Liu在亚马逊公司实习期间完成,导师为Prof. Pan Xu。Dr. Xingzi Xu和Dr. Mehmet Saygin Seyfioglu是亚马逊公司的Applied Scientist,Dr. Karim Bouyarmane是亚马逊公司的Senior Manager。