@SpaceXAI 在 ARC-AGI-2 上跑了一轮新成绩,结果有点尴尬:Grok 4.7 的最佳得分是 61.4%,每任务成本 $2.01;而上一代 Grok 4.6 的得分是 67.1%,每任务成本只要 $0.76。
得分从 67.1% 掉到 61.4%,成本却从 $0.76 涨到 $2.01。算下来,每任务成本上涨了 166%。
打开网易新闻 查看精彩图片
定价没变,账却更贵了
更让人困惑的是,输入和输出 token 的定价完全相同。也就是说,单价没动,但跑完一个任务要花的钱翻了不止一倍。
这意味着成本上涨不是价格调整带来的,而是任务执行过程中消耗的 token 变多了——同样的题,新版本花了更多的量去解。
完整结果已经公布在 ARC-AGI-2 的页面上,链接为 arcprize.org/results/xai-grok-4-7。
分数和成本,这次没站在同一边
通常版本迭代会带来分数提升,或者至少成本优化。Grok 4.7 这次两项都没占到:分数更低,成本更高。
对于关注推理模型实际使用成本的人来说,这组数字提供了一个具体的参照——在 ARC-AGI-2 这个基准上,新版本的性价比出现了明显倒退。
热门跟贴