SpaceXAI本周发布Grok 4.6,但真正值得琢磨的细节不是某个benchmark分数,而是他们**没做什么**——没有更大的底座模型。 Grok 4.6就是Grok 4.5外加一轮延长补充训练、重新生成的微调轨迹,以及在agentic环境里的强化学习。同一副地基,换了套教育方式。 而这套“教育”买来了不少东西:Artificial Analysis Intelligence Index上涨5分,目前61分,与GPT-5.6 Sol Max持平,也超过了Kimi K3。Terminal-Bench v3成绩从15.7%跃升至26%,接近翻倍。价格方面纹丝不动:每百万token仍收2美元/6美元,比Sol定价低了大约60%。附带的小字说明照旧——超过20万token提示词价格翻倍,"fast"版本费用再加一倍。 过去几年,更好的模型=更大的模型,更大的模型=更高的运营成本,于是能力和价格一路齐涨。但后训练升级打破了这条等式:推理成本没变,因为它本质上还是原来那个模型。5分的提升在权重的排列方式里,不在参数数量上——这就是为什么能做到评分跳涨而价格原地踏步。 同样的动作,行业里到处都在发生。今年各项进步几乎都来自agentic环境中的强化学习、更优质的轨迹数据、更长的精炼运行,而不再是参数数量——如今几乎没人拿参数量做宣传了。上周阿里披露2.4T参数之所以引人注目,恰恰是因为这种披露已经变得罕见。前沿模型的竞争,正在安静地变成一场课程设计竞赛。 对买token的我们来说,这无疑是件好事:单位美元能买到的能力持续提升,还省去了迁移到新模型家族的麻烦。Grok 4.6发布当天就上线了Cursor和API——同样的界面、同样的价格、更好的回答,外加一个新的xhigh推理档位,想更精细控制开销时可以用。 这次发布的重头戏是长时运行agent——500K上下文,专门在agentic环境里做RL,以及Terminal-Bench上近乎翻倍的成绩。
热门跟贴