Agent Arena的帕累托前沿被改写了。GPT-6 Sol(Max)拿出了一个+7.7%的净改进,而每任务的中位成本只要0.75美元。

这个数字放在榜单上,冲击力来自对比。它距离Claude Fable 5(High)的+8.3%只差0.60个百分点,但每任务成本低了56%——0.75美元对1.72美元。

打开网易新闻 查看精彩图片

0.6个点,56%的钱

把这两组数字摆在一起看,逻辑就很清楚了。性能上,GPT-6 Sol(Max)没有登顶,它排在Claude Fable 5(High)后面,差距是0.60个百分点。成本上,它几乎砍掉了一半多的开销。

帕累托前沿的意思,就是在性能和成本这两个维度上,找不到另一个方案能同时占优。GPT-6 Sol(Max)这次进入的,正是这条边界线。

榜单上的位置怎么读

Agent Arena给出的信息很直接:

  • 净改进:+7.7%
  • 每任务中位成本:0.75美元
  • 与Claude Fable 5(High)的性能差:0.60个百分点
  • 与Claude Fable 5(High)的成本差:56%(0.75美元 vs 1.72美元)

这组数据说明的不是谁最强,而是谁在某个价位上更难被替代。多花一倍多的钱,换0.60个百分点的提升,这笔账怎么算,取决于具体任务对性能的敏感程度。

一次发布,两个坐标

Agent Arena在公布这条消息时,也向OpenAI团队表达了祝贺。对做Agent产品的团队来说,这条前沿线的移动意味着选型时多了一个参照点:性能不是唯一变量,成本同样是。

+7.7%和0.75美元,这两个数字放在一起,构成了GPT-6 Sol(Max)在Agent Arena上的坐标。