同一个模型家族,同一批测试题,新版反而更"费脑"。Grok 4.7 在 ARC-AGI-2 半私有任务上的平均推理 token 用量,全面高于 Grok 4.6——在中、高、超高四档推理强度里,只有低档是例外。

换算成具体数字:按每个测试对(test-pair)的尝试次数算,中档多用了136%的推理 token,高档多用了125%,超高(xhigh)档多用了173%。唯一省下来的是低档,少了27%。

打开网易新闻 查看精彩图片

多烧的token,直接变成账单

推理 token 不是白烧的。用量上去,单任务成本就跟着上去——这也是 Grok 4.7 每个任务花费更高的直接原因。换句话说,同一道 ARC-AGI-2 题目,4.7 要"想"得比 4.6 久得多。

这个规律在四档推理强度里并不一致:低档反而更省,中、高、超高三个档位则一路走高。档位越高,多出来的比例越夸张,xhigh 档的173%是其中最高的。

20道最费token的题,被单独拎了出来

有一张图表专门对比了两个模型在 xhigh 档下的表现。样本是 20 道 ARC-AGI-2 公开任务——挑选标准是 Grok 4.7 在这些题上每次尝试消耗的推理 token 最多,排序依据则是相对 Grok 4.6 的 token 增量。

图里每个圆圈代表一道任务,数值是该任务下所有测试对、所有已记录尝试的平均值。也就是说,圆圈越大、位置越靠前,说明 4.7 在这道题上比 4.6 多烧的 token 越明显。

这组数据来自一次公开发布,时间是 2026年10月6日下午4:41。发布时附带的浏览量显示为110。

对开发者来说,这里有个现实问题:推理 token 涨了,成本就涨了。如果任务本身对精度要求没那么高,低档推理反而是更划算的选择——毕竟它是四档里唯一一个 token 用量下降的档位。