英伟达一篇新论文给出了一组对比数字:在医学研究基准上,一个9B参数的智能体,同时更新模型和技能文件时拿到69.1分;只改技能是56.1分,只训练模型是43.3分。
论文的结论很直接:面向长流程、多步骤任务的智能体,在"训练模型"和"编辑技能文件"之间交替进行时,提升幅度最大。只做其中一件事,大约会丢掉一半的收益。
打开网易新闻 查看精彩图片
问题出在打分方式上
多数环境只对最终结果打分。一个长流程跑完,分数出来了,但中间哪一步出了问题、哪一步拖了后腿,全被这个总分盖住了。
这就让改进变得盲目:不知道该往模型里补训练,还是该去改技能文件里的某一条规则。
VERA 的做法是把打分拆到每一步。它构建了超过9000个可重启的沙箱,每一步都对照真实文件和日志来检查,给出该步骤自己的评分。
分数决定下一步改哪里
有了逐步评分,下一步的修复方向就不再靠猜。论文给出的思路是:用每一步的评分对照真实产物,由这些分数来决定下一次修复是落到模型上,还是落到技能上。
两种更新交替进行,而不是二选一。这也解释了那组分数差距的来源——只练模型或只改技能,都只覆盖了问题的一半。
VERA 把基准测试的运行过程,转成了9000多个可重启沙箱。长工作流的每一步,都能从真实证据里拿到属于自己的清单式评分。
对做智能体的人来说,这个思路的价值在于:长流程任务的失败往往不是单点问题,而改进手段也不该是单点的。
热门跟贴