英伟达一篇新论文给出了一个反直觉的结论:想让智能体扛住长流程、多步骤的复杂任务,最有效的做法不是把模型练得更狠,也不是把技能文件写得更全,而是在两者之间来回切换。
论文里的说法很直接:只训练模型,或者只改技能配置,都会把大约一半的提升空间留在桌上。交替进行多轮更新,才能把这块空间捡回来。
问题出在打分方式上
大多数评测环境只给最终结果打分。任务跑完了,对就是对,错就是错,中间哪一步崩的,没人知道。
这种打分方式对长流程任务尤其不友好。一个几十步的工作流,最后失败了,可能是第三步读错了文件,也可能是第十七步调错了工具,但反馈信号里只有一句"整体没过"。
英伟达的做法是把评测过程拆开。VERA 构建了超过 9000 个可重启的沙箱,每一步都拿真实文件和日志去核对,给每个步骤单独打一个清单式的分数。
换句话说,长工作流里的每一步,都有了自己的成绩单,而不是等整场考试结束才知道总分。
分数决定下一步改哪里
有了逐步分数之后,接下来的问题就变成了:这一轮修复,应该改模型,还是改技能文件?
论文给出的答案是让分数来定。哪一步失分,就针对那一步决定修复方向——是模型本身的能力不够,还是技能配置没写对。
这个思路把原本混在一起的两件事拆成了两条独立的改进路径,然后交替推进。
在医学研究基准测试上,这套方法的效果被量化了出来。一个 9B 参数的智能体,两种更新方式都用上,得分 69.1。
只做技能编辑,得分 56.1。只做模型训练,得分 43.3。
三个数字摆在一起,差距不是一点半点。两种更新交替进行的组合,比单独做技能编辑高出 13 分,比单独训练模型高出近 26 分。
长流程任务需要不同的改进节奏
这套方法的核心逻辑可以概括成一句话:拿真实产物给每一步打分,再让这些分数决定下一次修复是进模型还是进技能。
对做智能体的人来说,这个结论指向一个具体的操作习惯——不要一次性把模型练到底,也不要指望把技能文件写到完美,而是让两者在轮次里互相补位。
9000 多个可重启沙箱的意义也在这里:它把一次性的基准测试,变成了可以反复进入、逐步归因的训练场。
热门跟贴