一个让开发者头疼的悖论:你花大价钱给模型做监督微调(SFT),结果它学会了新任务,却把老本行忘得干干净净。更夸张的是,这种“灾难性遗忘”能到什么程度?亚马逊在Nova 2模型的实验里发现,一个原本数学准确率70%的模型,经过纯SFT之后,平均直接掉到了6%。不是跌一点,是几乎清零。

问题出在推理链条上。SFT的理想状态是训练数据里带着高质量的思维链(CoT),也就是模型一步步推演的痕迹。但现实中,给数据集逐一补充推理过程又贵又慢,很多团队直接跳过了这一步,只用输入和输出做训练。跳过的代价,就是把模型内置的思维能力给“洗”掉了。亚马逊提出了一个新思路:自蒸馏推理(Self-Distilled Reasoning,简称SDR)。说白了,就是让基础模型自己先“想”一遍,把它的思考过程当作金标推理痕迹,填进那些缺CoT的数据集里。

打开网易新闻 查看精彩图片

具体怎么做?SDR直接复用Amazon Nova 2 Lite基础模型自带的思维链,把它作为站位符塞进原本没有推理的数据集。这样一来,模型在针对特定领域做SFT时,既有输入输出,也有伴随的推理步骤。从实验结果看,这种操作不仅把目标任务的性能拉上去了,还在很大程度上护住了通用能力。对比纯SFT检查点再往回合并的模型合并方案,SDR不需要在“新能力”和“老底子”之间做痛苦取舍。模型合并在保住通用性能的同时,往往会牺牲掉SFT获得的部分增益。而SDR在目标性能上持平甚至超过纯SFT,通用性能也没丢。

这跟近年来自蒸馏的研究趋势对得上——模型在训练中把信息“蒸馏”给自己,本身就能产生正则化效果。对开发者来说,实用启示很明确:下次做SFT,别直接砍掉推理过程。即便没有人工标注的高质量CoT,让模型自己生成一份,也比裸跑输入输出强得多。尤其是面对编程、数学这类硬骨头任务,省下这个步骤,可能意味着模型把整副骨架都丢了。