一个比老师小得多的学生模型,在没见过的任务上跑出了63.4%的成绩,而它那位8B的老师,被它甩在了身后。这不是段子,是一篇关于小语言模型智能体蒸馏的新论文给出的结果。
论文的名字叫 Harness-Aware Distillation,直译过来是"感知执行框架的蒸馏"。它要解决的问题很具体:小模型智能体在部署时,往往要挂在一个执行框架(harness)上跑,但训练的时候,模型并不知道这个框架的存在。
先看一组数字
研究者在 ALFWorld 上做了对比。把 harness 信息加进 on-policy 蒸馏之后,学生模型使用 harness 信息的频率从 65.7% 升到了 73.1%。
但成功率几乎没动:从 43.1% 到 43.5%。也就是说,模型确实更爱看框架信息了,可任务完成得并没有更好。这个反差,正是这篇论文想绕开的坑。
方法本身不复杂
Harness-Aware Distillation 的做法是:拿同一个老师模型,分别在有 harness 信息和没有 harness 信息的情况下各问一遍,然后训练学生去偏好那个"带着框架信息做出的动作"。
中间加了一道过滤器,把那些"偏好动作和 harness 记录相矛盾"的样本对丢掉。整套方法不依赖任务奖励,也不需要成功标签。
换句话说,它不告诉学生"这样做能赢",只告诉学生"老师在有框架信息时更倾向这样做"。
结果落在两个指标上
在未见过的 ALFWorld 任务上,学生模型达到 63.4%,而最好的基线是 47.0%。它同时超过了那个 8B 的老师模型。
另一个指标是"脱困率"——从卡住的状态里走出来的比例。学生模型能摆脱 59.7% 的停滞,而基线们基本停在未训练学生的 46.8% 附近。
论文地址是 arxiv.org/abs/2610.02858,另有一个对话入口 academy.dair.ai/papers/harness。
对小模型智能体来说,这套思路的价值在于:它把"框架信息"当成了一种可蒸馏的信号,而不是部署时才临时塞进去的上下文。学生学到的是"什么时候该看框架",而不是死记框架里的内容。
热门跟贴