研究员|王晨
8月25日,OpenAI的自研芯片Jalapeño“墨西哥辣椒”正式交出成绩单,时间点选在英伟达公布财报的前一天。
这也和自研芯片的使命契合——挑战“英伟达税”。
01 功耗更低,更快响应
6月24日,英伟达股东大会前,OpenAI正式公布了与博通合作开发的首款AI芯片Jalapeño。当时的介绍为“专为驱动ChatGPT、Codex、API以及未来代理型产品的LLM工作负载而构建”。
两个月后,Jalapeño终于交出了自己的第一份成绩单。
OpenAI的测试结果显示,Jalapeño表现出了明显的性能优势:Jalapeño能够在单位功耗下处理更多AI任务,同时还能更快地返回响应。
OpenAI称,这种性能优势并不局限于自家模型。在开源模型GPT-OSS 120B、DeepSeek R1以及Kimi K2.5 1T上均有体现。在这三个模型上,Jalapeño在峰值吞吐量下每瓦可完成的AI工作量达到对比系统的1.5至1.9倍,端到端延迟降低了1.7至3.6倍。对于高交互性工作负载,性能达到对比系统的2.1至4.1倍。
OpenAI分享了使用SemiAnalysis公开基准测试工具InferenceX的测试结果,从图表上看很夸张。
当Jalapeño与目前最好的加速器都运行在各自最优效率点时,Jalapeño的单位功耗综合推理吞吐量领先现有最佳加速器约1.5至1.9倍。在更为极端的情况下,领先幅度更大。例如,在保持与现有最佳加速器相同的最高单用户解码速度时,Jalapeño的单位功耗综合推理吞吐量高出约54至104倍。
OpenAI在文章中提到,芯片在设计之初就是围绕真实的语言模型工作负载,将芯片、内存、网络、软件和机架级系统进行了一体化设计,这才带来了如此大的性能优势。而且OpenAI团队还在设计过程中使用了AI进行辅助,这让团队能在9个月内完成从初始设计到流片的全过程。
OpenAI还提到,公司计划年底前开始在OpenAI的计算基础设施中部署Jalapeño。目前,第二代在紧锣密鼓地开发中,第三代也正在成型。
02 挑战“英伟达税”
Jalapeño首次公布是在英伟达股东大会的同一天,到英伟达公布财报的前一天又发布了芯片实测数据。
最直接的含义——OpenAI想要挑战AI时代的“英伟达税”。英伟达的整体毛利率高达75%,凭借着市场上实质的垄断地位,持续向所有算力需求方征收溢价。
随着大模型用户规模扩大,以及Agent任务复杂程度的提升,Token的调用量正在显著增加。TrendForce集邦咨询分析师龚明德告诉第四波,随着Agentic AI时代的到来,需求端要求AI推理应用场景的反馈更快速,这对推理场景的算力提出了新要求。
英伟达也注意到了相关的市场变化,在2025年12月,英伟达斥资约200亿美元获得了Groq公司的技术许可。Groq开发的芯片被称为LPU(Language Processing Unit),专为AI推理任务设计。Groq公司称,LPU运行大语言模型及其它AI模型的效率,可比GPU高出10倍。
在获得Groq技术授权后,英伟达进一步推出了NVIDIA Groq 3 LPX,并将其纳入Vera Rubin平台,与Rubin GPU组成异构推理系统。根据黄仁勋在GTC2026大会上的发言,Groq 3 LPU 和Vera Rubin 是两种不同功能的芯片,前者针对AI智能体系统对低延迟的需求,而后者满足的是长上下文的需求。据英伟达介绍,将两款处理器的性能结合,每兆瓦功耗的推理吞吐量最高可提升35倍。
但对算力买家来说,即便Vera Rubin的架构进一步升级,真正算起经济账,自研ASIC依然更划算。
Google Cloud曾披露,TPU v5e在特定大规模推理负载下,相比GPU部分场景下每美元性能可达到2.7倍,最高甚至超过4.2倍。同样的说法得到了亚马逊和微软的验证,微软称,专门面向推理的Maia 200相比Azure当时最新一代硬件,每美元性能提高了约30%。亚马逊云也曾公开称,自研的Trainium2相比通用GPU的成本可以降低30%至40%。
这对于OpenAI而言,无疑是个好消息。据海外研究机构整理,OpenAI在2025年的算力支出大约为163亿美元,其中研发与训练支出为83亿美元,推理支出为80亿美元。
训练与研发对通用GPU的依赖短期内难以改变,但接近一半的推理成本却有可能通过自研ASIC逐步压下来。
这也可以解释为何多家AI公司都在推进自研ASIC。Anthropic在今年8月明确了自研ASIC的计划,DeepSeek在今年六月被曝正在组建自研ASIC团队,此外,智谱也在评估自研ASIC方案。
编辑|符永康
热门跟贴