过去两年,OpenAI一直在悄悄打造一款名为“Jalapeño”的推理芯片,如今终于在Hot Chips上正式公布。此前关于成功流片的传闻已经流传了一段时间,而现在细节终于浮出水面。OpenAI邀请我们查看这款芯片,进入其实验室验证真实性,并用我们的InferenceX套件进行基准测试。

16个月完成从零到流片

打开网易新闻 查看精彩图片

今年6月,OpenAI公布了与博通合作的芯片项目,这款芯片从一张白纸开始,专门为LLM推理而设计。设计工作始于2024年年中,从最初组建团队到制造流片仅用了约16个月,这是一个极快的ASIC开发周期。

通常第一代芯片并不具备竞争力,但OpenAI打破了这一规律。在多个顶级开源模型上,Jalapeño击败了我们能够测试到的每一款英伟达、AMD和谷歌芯片,达到行业领先水平。OpenAI依靠极致的软硬件协同设计实现了这一点。令人意外的是,OpenAI并没有针对模型推理的某个特定环节过度专用化,而是专注于打造一款在所有场景下都能提供高性能的通用芯片。

并非专为OpenAI模型定制

很多人说OpenAI的芯片是为OpenAI模型专门优化的,但这种说法并不准确。OpenAI做的是一款面向AI推理的通用芯片。从规格来看,它立刻成为一个有力的竞争者。HBM4的使用让它足以与英伟达和AMD的旗舰GPU相提并论。

大量媒体报道沿用了OpenAI的一些随口评论,声称这款芯片会以其他芯片无法做到的方式针对其模型进行优化。这是错误的。Jalapeño是一款通用推理芯片,能够运行各种模型和各种工作负载,包括我们的InferenceX基准测试。我们与OpenAI工程师在实验室中运行了该基准测试。作为玩笑,OpenAI甚至向我们展示了它运行《毁灭战士》,这款游戏仅通过Codex提示就被移植到了他们的芯片上。

能效比全面领先

以下是我们的核心性能/功耗结果,考察的是每全效兆瓦的token吞吐量。Jalapeño碾压了所有其他芯片。这一切都是在没有使用多token预测(MTP)的情况下完成的,而图表中的其他芯片都是各自SKU的最佳配置,并且都启用了MTP。

Jalapeño在几乎所有场景下的性能/功耗都击败了Blackwell,而且没有针对曲线上的任何特定点进行调优。它不仅在低延迟场景中表现出色,在高吞吐场景中同样领先。与单token预测结果进行更公平的比较时,它把所有竞争对手都远远甩在身后。