清华NLP团队(OpenBMB成员)联合中科院大学、东北大学、UIUC和约翰霍普金斯大学,提出了One-Shot OPD。做法很直接:把OPD的训练集压缩到一条查询。
效果用数字说话。数学任务上,成绩从59.1提升到68.5,训练步数为300步。作为参照,使用全量数据的OPD能达到69.8——一条查询拿到了全量数据约87%的增益。
打开网易新闻 查看精彩图片
不止数学任务
这套方法在代码、指令跟随和智能体工具使用上也成立,并且跨Qwen、Llama、OLMo等多个模型验证通过。也就是说,它不是只对某一个模型、某一类任务有效的偶然结果。
把训练数据从"全量"压到"一条",省下的是数据准备和训练成本,留下的是接近全量的效果。对做模型后训练的人来说,这个比例值得记一下。
热门跟贴