“我们造了一颗芯片,它速度很快。”8月26日,OpenAI首席执行官山姆·奥特曼在社交媒体上官宣。
当天,OpenAI公布首颗定制推理芯片Jalapeño的技术细节,Jalapeño意为“墨西哥辣椒”,在峰值吞吐量方面,这枚芯片的每瓦峰值性能是参照系统的1.5至1.9倍,凭借单一架构同时实现高吞吐量和低延迟,单位功耗下可处理更多AI任务,响应速度更快。据彭博社报道,OpenAI芯片部门负责人Richard Ho在接受采访时表示,Jalapeño的参照对象是英伟达的GB300芯片。
混合Token吞吐量峰值。在最大公开模型Kimi K2.5 1T上,Jalapeño每瓦峰值性能约为参照系统的1.5倍。
Jalapeño的性能覆盖了GPT‑OSS 120B、DeepSeek R1和Kimi K2.5 1T等模型,该架构可在OpenAI内部及外部开发的模型上运行。在这三种模型上,Jalapeño在峰值吞吐量下的每瓦性能是参照系统的1.5至1.9倍。对于高度交互式的工作负载,其性能表现达到参照系统的2.1至4.1倍。Jalapeño的额定功耗为700瓦,在测试负载下,实测持续功耗维持在550瓦或以下。
OpenAI表示,这些性能意味着响应速度更快、智能体反应更灵敏、访问体验更可靠。Jalapeño专为大语言模型和交互式智能体设计,其性能提升源于围绕真实语言模型负载,协同设计芯片、内存、网络、软件及机架级系统。
语言模型推理过程包含多个不同阶段,每个阶段都有各自的瓶颈。系统处理提示词的预处理阶段属于计算密集型,系统生成响应的解码阶段则更多受限于内存带宽。数据传输时,通信延迟也会增加,导致部分处理单元在等待期间闲置。在某个阶段表现出色的系统,可能会在等待数据时丧失优势。为了最大限度地减少数据传输和通信延迟,Jalapeño可实现KV缓存(KV cache)等保持在本地,同时系统为每个推理阶段激活恰当的计算、内存和网络组合。
“我们计划今年年底前在OpenAI的计算基础设施中开始部署Jalapeño。”OpenAI表示,第二代芯片正在深度开发中,第三代已初具雏形,每一代都将基于积累的经验提升效率和速度。
值得注意的是,OpenAI的芯片并非为训练新模型而设计,这意味着模型训练仍然高度依赖英伟达等供应商。“我们需要大量算力。”Richard Ho在采访中表示,OpenAI的Jalapeño、英伟达和AMD都是算力的一部分。
澎湃新闻记者 张静
热门跟贴