一份来自Artificial Analysis的最新对比数据,让大模型排位赛又有了新看点。Grok 4.6(High)在多项关键基准上,分数反超了OpenAI的GPT-6 Astra(Max)。
差距最明显的是Agentic Index,Grok拿下59分,对手为51分。在考验金融推理的τ3-Banking测试中,Grok以51%对41%领先10个百分点。抗幻觉能力同样占优,66%对49%的成绩,意味着它在事实准确性上更稳。
打开网易新闻 查看精彩图片
GDPval-AA v2的比拼也以1,730对1,629收场,Grok继续保持领先。这组数据覆盖了智能体能力、专业推理和事实性等多个维度,并非单一指标的偶然胜出。
作者在发布数据时还补了一句:Grok 4.7已经在路上了。这意味着这场头部模型的性能竞赛,远未到终局。
热门跟贴