Grok 4.7 的推理 token 用量,和它在 ARC-AGI-2 上的公开得分挂上了钩。@SpaceXAI 给出的数据很直接:low 档平均每次测试对尝试只用 10k token,得分 25%。

而 medium 到 xhigh 档,token 用量跳到 86k 到 120k,得分也跟着抬到 57.5% 到 60%。同一套测试,用量差了一个数量级,分数差了三十多个百分点。

打开网易新闻 查看精彩图片

低用量可能拖了后腿

按 @SpaceXAI 的说法,low 档更低的 token 用量,可能有助于解释它更低的得分。这句话没有把因果说死,但把两个数字摆在了同一张表上。

换句话说,Grok 4.7 在 ARC-AGI-2 上能拿多少分,和它愿意花多少推理 token 高度相关。省 token 的档位,分数也省了。

对使用者来说,这是一个取舍:要低成本快速出结果,还是堆 token 换更高的准确率。Grok 4.7 把这条曲线公开了出来。