“人工智能进步的速度现在真是疯狂。”一位用户在SpaceXAI的评论区感慨。就在同一天,DeepSeek、阿里千问和马斯克的SpaceXAI同时发布新模型,不少测评博主和从业者表示,“又是一个不眠夜”。
当地时间8月12日,距离上一代模型Grok 4.5的发布时间仅一个多月,SpaceXAI发布了最新版的大模型Grok 4.6。
根据各类评测,SpaceXAI这次最突出的特点是,在模型能力追平了竞争对手OpenAI,仅次于Anthropic。同时模型也延续了上一代的性价比优势,“加量不加价”饱受好评。
有用户表示,“去年没想到Grok 会变得这么好”。很难想象,就在今年5月,Grok 4.3还在大模型智能指数上排到第17位,与OpenAI、Anthropic等头部模型有明显差距,但现在,它已经可以与第二名并驾齐驱了。
靠着新模型,马斯克也成功在AI领域打了一场翻身仗。对于这一模型的宣发马斯克也相当积极,就在模型上线后的2小时内,他转发了约10条推文称赞新模型,称Grok 4.6“智能、快速且性价比超高”,在考虑智能、速度和成本时,Grok 4.6“客观上是第1”。
Grok 4.6主要面向长时间运行的智能体,以及更复杂的交互式、视觉化任务。按照官方描述,它能够持续完成跨越多个步骤的工作,包括研究主题、分析信息、在大型代码库中协作,以及将一个想法转化为可运行的应用或作品。
AI大模型评测机构Artificial Analysis的分析显示,SpaceXAI的Grok 4.6在智能指数上得分61,与OpenAI的旗舰模型GPT-5.6 Sol 齐平,落后于 Claude Opus 5(63)和 Claude Fable 5(62),略高于国内模型Kimi K3(60)。
Grok 4.6更突出的优势出现在智能体知识工作上。在GDPval-AA v2(一项用于测试AI完成高经济价值职场任务能力的评测)中,Grok 4.6获得1753分。SpaceXAI官方列出的对比数据显示,这一成绩高于Claude Fable 5的1741分和GPT-5.6 Sol的1728分;Artificial Analysis则称,其目前仅落后于Claude Opus 5。
Grok 4.6延续了上一代的性价比路线,这一代能力升级了,但主要定价与Grok 4.5保持不变,每百万输入/输出token 为2美元/6美元,比Claude Opus 5(5 美元/25 美元)和GPT-5.6 Sol(5 美元/30 美元)低60%以上。
Artificial Analysis的数据显示,Grok 4.6的每任务成本为0.84 美元,与Kimi K3相同,但智能分数略高,因此目前Grok 4.6是综合能力与每任务成本的最优模型。
“以相同价格获得重大升级总是好消息。如果Grok 4.6在不涨价的情况下比4.5提供明显更好的推理能力和可靠性,那对用户来说就是一次扎实的升级。”有开发者表示。
在智能体场景中,模型需要反复调用工具、读取文件、修改代码并自我检查,一项任务可能持续数十分钟甚至数小时,token消耗会被迅速放大。模型能否以更少的钱稳定完成任务,直接影响产品毛利率和规模化部署。这也是“加量不加价”受到开发者欢迎的原因。
兜兜转转,经历动荡和重整,SpaceXAI重新回到大模型前沿。有行业人士将这种进步与收购 Cursor 联系起来,毕竟就在收购后,Grok就取得了巨大进步。
今年6月,SpaceX宣布以600亿美元全股票交易收购Cursor。马斯克此前承认,其AI业务在编程领域存在差距,并为此推动了一轮人员调整。与Cursor的合作,是SpaceXAI补足短板的关键一步。
Cursor此前透露,Grok 4.5训练过程中引入了数万亿token的Cursor真实开发数据,这些数据不仅覆盖大量代码库,还记录了开发者如何修改代码、如何调用工具,以及如何与AI智能体协同工作,使模型能够学习真实的软件开发流程,而不仅仅是代码本身。
根据SpaceXAI披露的信息,Grok 4.6进行了比上一代更长时间的补充训练,使用了经过筛选的模型生成数据(用于推理和高级技术概念)、高质量的工程数据,以及改进的优化器和训练方案。
当然,不能把Grok 4.6的进步简单归功于收购,算力、数据、后训练方法和工程优化共同决定模型效果。但无论如何,对马斯克而言,Grok 4.6确实让SpaceX的AI故事变得更好讲了。它也证明,经历组织调整和技术补课后,Grok仍有能力以很快的速度回到前沿。
热门跟贴