一个便宜的开源模型,能击败最顶级的闭源模型么?斯坦福最新的一项实验给出了肯定的答案。

在Terminal-Bench 2.1 上,斯坦福研究人员使用 DeepSeek V4 Flash,让它针对同一个任务生成 5 个候选解决方案,再由同一个模型充当“裁判”,利用 LLM-as-a-Verifier 对这些方案进行评分和排序,最后提交得分最高的答案。

打开网易新闻 查看精彩图片

结果,准确率从单次生成的 79% 提升到了 88%,超过了 Claude 最新的 Fable 5。更夸张的是,达到这一效果的成本只有后者的大约 1/11。

这件事真正值得关注的,并不是简单的“DeepSeek 击败 Claude”,而是它展示了一条完全不同的模型能力提升路径。

打开网易新闻 查看精彩图片

传统的 Agent 工作方式,往往是模型拿到任务后直接给出一个答案。其问题在于,第一次生成并不一定是模型能力的上限。它可能犯错,也可能在多个可行方案中随机选到一个较差的方案。

如果让模型一次生成 5 个答案,就相当于给它增加了 5 次“尝试机会”。但光有多个答案还不够,因为你还需要知道哪个最好。

这就是 LLM-as-a-Verifier 的核心。

它的思路并不复杂:让大语言模型不仅负责“做题”,也负责“阅卷”。

过去很多评测采用 1~5 分这样的粗粒度评分,让模型给一个答案打分,然后直接拿这个分数判断好坏。

LLM-as-a-Verifier 则进一步把评分做细,例如使用 1~20 的评分尺度,同时不只是看模型最终选择了哪个分数,还利用模型对不同评分结果的概率分布,也就是 logprob,计算出更加细致的期望评分。

简单理解,就是不再问模型:“你觉得这个答案是 1 分还是 5 分?”

而是进一步观察:“你有多大把握认为它是 15 分、16 分、17 分……?”

这样得到的评价信号更加细腻,也更适合拿来比较多个候选答案。

打开网易新闻 查看精彩图片

在 DeepSeek 的这个实验里,正是利用这种验证机制,让模型从自己生成的多个答案中进行筛选。

生成和验证使用的是同一个 DeepSeek V4 Flash,但两者扮演的是不同角色:前者负责尽可能多地寻找解决方案,后者负责判断这些方案谁更可靠。

过去提升模型性能,主要依赖训练阶段——增加参数、增加数据、训练更强的模型。

但现在,可以尝试把注意力转向 test-time scaling,也就是测试时扩展。

就是说,模型训练完成之后,在真正解决问题的时候,允许它多花一些计算量。

不仅是生成 ,还要验证、排序 、选择,而且这个过程还可以继续扩展。

比如,不只是生成 5 个答案,可以生成更多;不只验证一次,可以重复验证;不只简单地给答案打分,还可以把任务拆成多个维度分别评价。

这也是 LLM-as-a-Verifier 论文更值得关注的地方。

研究人员发现,验证本身同样可以进行“扩展”。

打开网易新闻 查看精彩图片

他们使用更加细粒度的评分、完整的评分概率分布,以及重复评估和任务分解等方法,让验证器提供更丰富的信号

这些信号不仅可以用于从多个答案中挑选最优解,还可以进一步用于强化学习、测试时扩展以及 Agent 的运行监控。

最终,这套方法在 Terminal-Bench V2、SWE-Bench Verified、RoboRewardBench 和 MedAgentBench 等多个 Agent 基准上取得了 SOTA。

当然这并不是说,便宜的开源模型超过了最强闭源模型,而是证明了在足够低的成本下,模型可以通过“多生成+自验证”把整体性能推到一个新的水平。

这种思路如果拓展开来,对 AI 大模型的发展能提供怎样不一样的方向呢?