一个新模型把“性能追平最强”和“价格大幅下探”两件事同时做到了。Grok 4.6在Artificial Analysis Intelligence Index上拿到61分,和OpenAI的GPT-5.6 Sol并列。排在其前面的只剩Anthropic的Claude Opus 5(63分)和Claude Fable 5(62分)。
相比上一代Grok 4.5,这次直接涨了5分。在行业普遍把模型迭代当作“挤牙膏”的当下,这个提升幅度并不常见。更值得注意的是,它没有靠堆算力或拉高价格来换成绩。
代理能力:53步完成复杂任务,几乎是对手的一半
Grok 4.6最突出的表现集中在代理任务(Agentic Tasks)上——这类任务要求模型自主完成多步骤工作流,而不是简单地生成一段文字。在衡量真实计算机知识工作的GDPval-AA v2基准中,Grok 4.6以1,753的Elo评分排名第二,仅次于Claude Opus 5。
一个细节很能说明问题:完成同样的复杂任务,Grok 4.6大约需要53步,而Claude Opus 5需要103步。步骤数几乎减半,意味着在执行多阶段任务时,它的规划效率更高、中途出错的可能性更低,同时也能明显减少调用成本和延迟。
定价直接砍掉六成,每百万tokens仅2美元起
性能逼近第一梯队的同时,Grok 4.6的定价维持在每百万tokens 2美元(输入)/6美元(输出)。对比来看,Claude Opus 5的定价是5美元/25美元,GPT-5.6 Sol为5美元/30美元。也就是说,Grok 4.6的价格比这两个对手便宜了超过60%。
性能差距缩小到两三分的程度,价格却只有对手的三分之一左右,这对开发者和企业的模型选型会产生直接影响。对成本敏感的中小型团队尤其友好,他们可以用更低的预算尝试前沿模型的能力。
上线即铺渠道,第一周双倍用量
Grok 4.6已经通过API、Cursor、Grok Build以及OpenRouter、Vercel、Cloudflare等合作伙伴开放使用。其中,Cursor的接入比较关键——不少开发者日常就在编辑器里完成大量编码任务,模型的选择直接影响到他们的工作效率和调用成本。
首发推广也做得直接:x.ai在Grok Build和Cursor两个平台上限时一周提供双倍用量配额。对于想测试它代理能力和编码表现的团队来说,这段时间正好可以低成本验证效果。
影响:性能天花板在被拉平,价格战开始波及第一梯队
Grok 4.6的发布释放了一个明确的信号:第一梯队模型的性能差距正在缩小,而价格正在成为新的竞争焦点。从前只有两家公司能提供接近满分水平的模型,现在第三家进来了,而且把价格锚点拉低了一大截。
接下来需要观察的是,OpenAI和Anthropic会不会在下一代模型中调整定价策略,还是继续用更高的分数来维持溢价。对普通用户来说,选择变多了,好事情。
热门跟贴