马斯克深夜掀桌!最强旗舰Grok 4.5突袭,数万块GB300炼出性价比之王,不仅硬刚GPT-5.5,性能紧贴Opus 4.8,又快又便宜。
Grok 4.5,终于交卷!
就在刚刚,马斯克SpaceXAI震撼发布自家史上,最强旗舰模型Grok 4.5。
这一次,SpaceXAI与Cursor强强联手。
在数万块GB300巨兽上,硬生生「炼」出这个专为编码、智能体而生的性能怪兽。
成绩单相当亮眼——
SWE Bench Pro:豪取64.7%,正面硬刚并越过Opus 4.7的64.3%;
Terminal Bench 2.1:一路狂飙至83.3%;
DeepSWE 1.0:稳稳站上62.0%,强势碾压Opus 4.8。
马斯克直言,「Grok 4.5大致相当于Opus 4.7,但快得多」。
能力、速度、成本三者叠加,才是它的竞争力所在。也就是说,它干活儿用的Token,只有别人的零头。
Grok 4.5输入价格$2/百万token、输出价格$6/百万token。
相较于Opus 4.8,Token消耗暴减4.2倍。
#01
数万块GB300,炼出一个「Opus级」
Grok 4.5,是SpaceXAI上市后第一张王牌,也是他们联合Cursor交出的第一份答卷。
那么, 它是怎么练出来的?
答案是,数以万计的英伟达GB300 GPU,一次超大规模的训练。但堆算力,只是入场券。
马斯克预告:下周Grok 4.5上下文升级至100万
SpaceXAI真正下死功夫的地方,是数据。
他们对海量语料进行了魔鬼般的过滤、去重和质量打分,确保灌进模型的每一口,都是高信息密度的专业内容。
然后,他们把RL的重心,压在了一个很少有人挂在嘴边的指标上——「单Token智能度」(per-token intelligence)。
而Cursor的加入,是这套飞轮里最关键的一环。
Grok 4.5底座是V9(1.5T),官方介绍,训练时喂进了数以万亿计的Cursor数据。
这些数据记录了真实开发者如何与代码库、与工具、与智能体互动。
这意味着,模型学到的不只是「代码长什么样」,而是「人和AI是怎么一起写代码的」。
而它的训练栈,是为高度异步设计的——
智能体可以连续跑上好几个小时,模型一边干活一边继续学,几万块GPU上的训练一刻不停。
结果就是,它不光会做题,更能在长达数小时的长任务里,扛住多步骤的复杂工程。
#02
打平GPT-5.5,逼近Opus 4.8
这一套训练打法下的Grok 4.5硬核性能,绝对经得起检验。
在几个核心工程榜单上的表现,它可以用「稳」来形容——不是最强,但足够挤进第一梯队。
在DeepSWE 1.0上,它拿下62.0%,压过了Opus 4.8(55.75%),紧咬GPT-5.5(64.31%);
在Terminal Bench 2.1上,它冲到83.3%,和GPT-5.5(83.4%)只差0.1!;
在更硬核的SWE Bench Pro 上,它以64.7%的解决率反超了GPT-5.5(58.6%),逼近Opus 4.8(69.2%)。
在AAAI官方测试中,Grok 4.5排名第四,仅次于Fable 5、GPT-5.5、Opus 4.8。
在Harvey法律智能体基准测试中,位列第一。
不得不说,这份成绩单很能打。
但必须承认的是,当前稳坐铁王座的,依然是Claude Fable。
总言之,Grok 4.5和GPT-5.5基本打平,紧贴Opus 4.8,但离真正的天花板还有一段距离。
马斯克自己也说得很实在:「我们内部的评估是,Grok 4.5大致和Opus 4.7相当,但快得多」。
#03
真正的杀手锏:又快又便宜
Grok 4.5真正的暴击,藏在速度、效率和价格这三个字上。
其的推理速度高达80 TPS(每秒Token数),官方原话是「比flash类模型还快」。
仅凭一句话,它就用Three.js写出了一个太阳系3D模拟器:
支持时间加速,八大行星轨道运动逼真,连HUD面板都做得相当讲究。
效率方面,在SWE Bench Pro任务里,Grok 4.5平均只输出15,954个Token就把问题解决了。
而Opus 4.8做同样的活,平均要吐67,020个Token。
4.2倍,Grok 4.5用了不到对手四分之一的Token,就把同一道工程题做完了。
价格上,输入每百万Token 2美元,输出每百万Token 6美元。
此外还有一个更快的高级版本,定价输入$4/输出$18。
对比一众动辄十几美元起步的顶级模型,这个价格几乎是把成本打到了几乎骨折。
三个数字叠在一起,结论就一句话:
在「单位时间、单位成本能买到多少智能」这件事上,Grok 4.5目前就是那个「性价比之王」。
#04
全网实测:Grok 4.5真实表现
此外,从广大网友的实测反馈中,可以窥见Grok 4.5真实能力的一角。
一句话,直出「我的世界」。
在一个单独的HTML文件中,Grok 4.5能轻松搞定一个完整的高端SaaS页。
Grok 4.5大显身手,在应用内不到一分钟就完成了整套2D+3D设计方案。
AI游戏大神Danny Limanseta用Grok 4.5生成了一款游戏,各种功能齐全。
不过,也有开发者表示,Grok 4.5完全与Opus 4.7不在同一个水平,生成的熔岩灯测试,效果很差。
#05
不是最强,憋着下个月掀桌
今天,马斯克又埋了一颗雷:
Grok深谙工程之道。
下个月的版本会是又一次阶跃式的提升,因为我们正在特斯拉、SpaceX、Neuralink和Boring Company里,闭合解决真实工程问题的那个环。
下个月,再来一次阶跃。 且据传,一个2万亿参数的更大版本已在路上。
跑分,是给外行看的烟花;效率与成本,才是把对手拖进消耗战的真枪实弹。
当模型的智能开始像电力一样按度计费,胜负手就是谁能让智能变得又快、又便宜、又无处不在。
这一次,马斯克没拿最强的牌,却把牌桌掀了。
参考资料:
https://x.ai/news/grok-4-5
https://cursor.com/blog/grok-4-5
公众号最近更改了推送规则,不再按时间顺序推送,而是根据人工智能算法有选择性向用户推送,有可能以后你无法看到赖博士的文章推送了。
解决方法是将《赖博士说》的公众号“星标”,顺手点下文末右下角的“在看”,系统会默认我们公众号的文章符合你的喜好,以后赖博士的文章就会在第一时间推送到你面前。
赖博士说
赖博士说
帮你站在高处,重新理解财富
赖博士说
公众号:@赖博士说
视频号:@赖博士说
小红书:@赖博士说
今日头条:@赖博士说
Youtube:@赖博士说
免责声明:本公众微信平台“赖博士说”所载的资料及说明只可作一般性参考资料来阅读。平台不会就文章内资料、或因使用此等资料之正确性、准确性、可靠性或其他方面所导致的后果作出任何保证或其他声明。平台有酌情权随时删除、暂时停载或修改本帐号上的各项资料而无须给予任何通知或理由。若资料内容涉及产品资料,一概只可作一般性参考且并非适用于各产品及服务的所有条款及细则。详细资料请参阅有关产品及服务之协议。本文内容仅供内部参考及培训使用,并不构成任何法律、税务、投资或其他专业意见。
热门跟贴