研究级数学题,两个模型的得分只差0.9个百分点,但每道题的花费差了三倍多。这个对比来自一个刚更新的基准测试。
测试的名字叫BrokenArXiv和ArXivMath,发布方公布了最新版本。和常见的数学基准不同,这批题目专门挑的是近一个月内被推翻的arXiv猜想——也就是说,模型面对的不是有标准答案的老题,而是刚被证伪的前沿问题。
分数很接近,账单差很远
根据公布的数据,GPT-6 Astra在这项基准上拿到88.6%,Fable 5.1拿到87.7%。前者领先,但幅度只有0.9个百分点。
真正的差距在成本一侧:GPT-6 Astra每道题花费3.63美元,Fable 5.1每道题花费12.77美元。换算下来,前者用不到后者三分之一的成本,跑出了略高的分数。
发布方的原话是"similar performance at less than one-third the cost"——相近的表现,不到三分之一的成本。
为什么这批题不一样
BrokenArXiv和ArXivMath这次做了两处调整。
第一处是题目来源。基准聚焦的是上个月在arXiv上被推翻的猜想。这类题目有个特点:它们在被证伪之前,是开放问题,没有现成解法可以检索。模型没法靠记忆训练数据里的答案过关。
第二处是执行方式。模型不再直接通过API调用,而是放在一个harness(测试框架)里运行。这个改动意味着评测环境更接近真实使用场景,而不是单次接口请求。
发布方对整体表现的评价是"performance remains impressive",并确认GPT-6 Astra排在最前。
0.9个百分点能说明什么
单看分数,两个模型几乎打平。但把成本和分数放在一起看,结论会变。
如果一道题的成本是12.77美元,跑一千道题就是一万两千多美元;换成3.63美元,同样一千道题只要三千六百多美元。对于需要大规模跑基准、反复做消融实验的团队来说,这个差额不是小数。
反过来说,Fable 5.1在分数上并没有被拉开明显差距。它输的是性价比,不是能力上限。
这批数据也留下一个开放问题:当基准开始用"刚被推翻的猜想"出题,模型比拼的就不再是记住了多少,而是能不能在陌生问题上推理。在这个维度上,两个模型的差距被压缩到了1个百分点以内。
发布方没有解释成本差异的来源,也没有说明两个模型在解题路径上有什么不同。目前能确认的只有两组数字:88.6%对87.7%,3.63美元对12.77美元。
热门跟贴