OpenAI今天正式公布了首款定制推理芯片Jalapeño(墨西哥辣椒)的首批实测性能数据。在基于开源模型GPT-OSS 120B的公开基准测试InferenceX上,这颗芯片的每千瓦峰值吞吐量和Token延迟均优于现有硬件系统。
测试统一设置为8K输入、1K输出,使用标准单token预测,没有开启推测解码。对照系统包括英伟达GB200和GB300。结果显示,在GPT-OSS 120B、DeepSeek R1 670B和Kimi K2.5 1T三个模型上,Jalapeño的峰值吞吐量每瓦AI工作量是对比系统的1.5到1.9倍,端到端延迟降低1.7到3.6倍,高交互性工作负载性能提升2.1到4.1倍。
最极端对比项差距显著
在GB200此前最佳的单用户速度约535 tok/s下,Jalapeño的每千瓦吞吐是前者的53.7倍。跑DeepSeek R1时,Jalapeño单用户可达700 tok/s,对标系统只有169 tok/s。Jalapeño标称功耗仅700W,实测持续功耗不超过550W。
奥特曼在X上评价:“我们造了一颗芯片,快得离谱。”知名科技Newsletter SemiAnalysis创始人Dylan Patel则表示,第一代芯片通常毫无竞争力,但OpenAI正在打败英伟达Blackwell,甚至Rubin。
没有投机解码,仍赢过软硬件优化的对手
更值得注意的是Jalapeño的达成方式:没有多token预测(MTP)、没有投机解码、没有prefill-decode分离,就这样赢过了软硬件优化的英伟达对手芯片。SemiAnalysis的技术博客验证了测试过程,并确认Jalapeño跑出的GSM8k精度与英伟达芯片持平。
X上的讨论也有冷水。daily.dev开发者社区指出,疯传的“104.3倍”只是特定等速解码场景下的单一数据点,测试模型和对比基线都是OpenAI自己挑的。SemiAnalysis也承认,Jalapeño还没跑过多轮长上下文的AgentX测试;真正的对手应该是同样用HBM4的Vera Rubin而非Blackwell。
即便如此,最终共识依然是:第一代自研芯片就站上帕累托前沿,这在行业里没有先例。Meta和微软折腾多年始终难产的AI ASIC项目,是最好的反证。
通用推理引擎,不是OpenAI模型专用
外界一度认为OpenAI造芯是给自家模型开小灶,SemiAnalysis则提到Jalapeño是通用推理芯片。测试表现最好的三个模型里,DeepSeek R1和Kimi K2.5根本不在OpenAI最初的投产计划内。团队还提到用Codex两个月就把它们优化到了高性能,并且在这颗芯片上成功运行了游戏《Doom》,移植全程只用了Codex提示词。
硬件上,Jalapeño采用台积电N3P工艺,最新的B0步进单计算die提供13.4 PFLOPS的MXFP4算力。同工艺、同尺寸的英伟达Rubin计算die是17.5 PFLOPS(NVFP4),但Jalapeño的TDP只有700W,Rubin是900~1150W。
设计逻辑:让数据待在原地,减少搬运
要理解Jalapeño,得先知道大模型推理其实是两种完全不同的活:处理prompt的prefill阶段吃算力,逐字生成回答的decode阶段吃显存带宽,而数据在核心间、芯片间搬来搬去的通信开销则在两边拖后腿。多数系统擅长其中一种,却会在等待数据时把优势浪费掉。
Jalapeño的核心思路,是尽可能让数据待在原地,减少搬运。芯片的核心和HBM都被切成一一对应的切片,每个核心切片对自己那片HBM拥有低延迟的本地视图;KV cache和模型权重被显式地安置在原地,生成过程中不再挪窝。切片之间需要同步时,可以走一条专用的高带宽集合通信网络,通用通信则交给另一张简化的NoC。对比GPU里层层穿越的复杂内存体系,这套“极简内存层级”省掉了大量的延迟和功耗。
这套方法论可以总结成两步:硬件负责把理论上限拉到最高,AI负责找到逼近上限的写法。结果是它在各种批量、各种形状下都更接近硬件的屋顶线(roofline),尤其是GPU最不擅长的小批量、低延迟场景,而这些又恰好是agentic工作负载最在意的地方。
系统层面:统一池子,不做PD分离
OpenAI没有采用目前热门的优化路线:PD分离(prefill和decode分池部署),理由是真实流量里输入输出的比例全天都在漂移,固定分池必然一边闲置一边排队,KV cache跨池搬运还会平添功耗和延迟。
统一池子里,128颗芯片组成一个机架(CPU托盘叫Katsu、ASIC托盘叫Vindaloo、交换托盘叫Chana,都是一串咖喱菜名),16个机架再用铜缆加光交换织成2048颗芯片的单一scale-up域。整个请求从进来到出去,数据都不需要使用PD分离的转移。
用AI造芯片,才是真正的秘密武器
如果Jalapeño的故事只到这里,它仍然只是一颗性能很强的ASIC推理芯片。真正让这件事有点反常识的,是OpenAI把AI用在了造芯这件事本身。从Codex两个月优化出DeepSeek R1和Kimi K2.5的高性能,到用提示词完成《Doom》的移植,AI在芯片设计和软件适配中的角色已经不只是辅助。
对规模化推理服务来说,芯片最终拼的除了跑得多快,还有花同样的电、占同样的数据中心容量,能服务多少用户。换成云计算生意里的语言,就是一句很直接的话:“每瓦吞吐,最后都会变成成本和收入。”
从数据中心到手机,AI芯片正在成为所有科技巨头共同争夺的一块地盘。小米刚刚一口气公布三颗自研芯片,苹果昨天发布首颗2nm M6,接下来一个月,高通、联发科、苹果和华为的新一代旗舰芯片还会继续扎堆登场。OpenAI这颗“辣椒芯片”能不能让ChatGPT更便宜,答案还要等规模化部署之后才能揭晓。
热门跟贴