教师模型的“出身”,比分数更关键

一篇关于模型蒸馏的研究给出了一个反直觉的结论:学生模型复制的是教师模型的推理方式,而不是教师模型掌握的知识本身。这意味着,教师模型来自哪个模型家族,远比它在基准测试上的分数重要。

打开网易新闻 查看精彩图片

研究指出,一个从学生模型自身基础模型构建出来的较弱教师模型,反而能比来自不同模型家族的更强教师模型,把学生带得更远。

训练数据几乎不影响结果

论文发现,训练数据的影响微乎其微。无论你拿教师模型总能解出的题目、永远解不出的题目,还是随机混合的题目来训练,学生模型最终都会落在差不多的位置。

甚至只用小学数学级别的题目,也能获得超过80%的收益。这个结果说明,蒸馏过程中真正传递的东西,并不藏在题目本身。

教师解不出的题,也能教给学生

更值得注意的一点是:教师模型可以教会学生一道它自己都解不出的题。因为跨模型传递的是一种推理习惯,而不是某道题的答案或解题能力。

这解释了为什么教师模型的推理方式,比它的知识储备更能决定学生模型的上限。