一篇新论文对当前大模型训练中流行的“在线策略蒸馏”(On-Policy Distillation)提出了尖锐质疑:它到底是在蒸馏知识,还是仅仅在模仿一个“吵闹的老师”?论文作者认为,传统做法存在根本性缺陷,并提出了一个无需监督信号的新方法OPSA,让模型实现自我改进。

“吵闹的老师”问题在哪

打开网易新闻 查看精彩图片

在线策略蒸馏的核心逻辑,是让一个学生模型去学习老师模型(通常是更大或更强的模型)的推理过程。但论文指出,老师模型给出的推理路径并非总是正确,其中夹杂着大量噪声——这些错误步骤同样会被学生“照单全收”。

更关键的是,当学生模型的能力逐渐逼近老师时,继续模仿一个可能出错的老师,反而会限制学生自身的潜力。论文标题直接点出这一悖论:在线策略蒸馏,真的在蒸馏吗?

OPSA:把“自我提升”变成主路径

针对上述问题,论文提出了OPSA(On-Policy Self-Improvement Approach)方法。其核心思路是:不再依赖外部老师的监督信号,而是让模型在自身生成的推理路径上进行优化。

具体而言,OPSA利用模型自己产出的数据,通过筛选和对比,识别出相对更优的推理轨迹,并以此作为学习目标。这样一来,模型摆脱了对“可能出错”的老师输出的依赖,转而从自身成功与失败的对比中提取有效信息,实现真正的自我改进。

从“模仿”到“反思”的转变

这一方法的本质,是将训练范式从“模仿学习”转向“自我反思”。传统蒸馏假设老师永远是对的,但OPSA承认老师(包括模型自身)会犯错,并试图通过对比自身不同尝试的结果,来区分有效推理与无效推理。

这种无需额外监督信号的设计,意味着OPSA可以在不依赖人工标注或更强外部模型的情况下,持续提升模型性能。对于推理成本敏感或数据标注困难的场景,这一特性具有实际价值。

对训练范式的启示

论文的质疑并非否定蒸馏本身,而是提醒研究者关注蒸馏过程中“噪声传递”的风险。当学生模型能力较弱时,模仿老师是高效的;但当学生能力接近老师时,继续单向模仿可能成为瓶颈。

OPSA提供了一条补充路径:在蒸馏之外,让模型学会从自身经验中迭代。这种“自我提升”机制,或许是大模型训练从依赖外部强信号,走向自主进化的一个值得关注的方向。