Perplexity 公布了一项新研究:通过提示引导的自蒸馏,对一个 Computer 模型进行后训练,让它从自身错误中学习。

在一次线上 A/B 测试中,较晚训练的 checkpoint 相比早期 checkpoint,将工具调用失败率降低了 21.2%。

打开网易新闻 查看精彩图片

这项研究的思路是让模型从自身错误中学习,而不是依赖外部标注。后训练过程中,提示引导的自蒸馏成为关键手段。

线上 A/B 测试的结果直接体现在工具调用失败率上:较晚训练的 checkpoint 相比早期 checkpoint 降低了 21.2%。