在周二的Hot Chips大会上,OpenAI首次公开了Jalapeño芯片的基准测试结果。测试基于Semianalysis的InferenceX基准,数据显示,Jalapeño在单用户token生成量和每千瓦吞吐量两项指标上,均超过当前可用的最先进推理处理器

性能对比:能效与延迟双线领先

打开网易新闻 查看精彩图片

OpenAI硬件负责人Richard Ho在媒体电话会上表示,测试结果表明Jalapeño相比现有顶尖方案实现了非常显著的性能提升。他解释,Jalapeño可以在单位功耗下处理更多AI工作负载,同时更快返回响应,既能高效服务大量客户,也能保持低延迟。

需要留意的是,这次对比对象是英伟达Blackwell系统。但到Jalapeño全面部署时,竞争对手可能已经进一步迭代。Ho预计,Jalapeño将在2026年底以极小批量开始部署,更成规模的落地要等到2027年。

全栈协同设计:从模型到芯片一体开发

Jalapeño于去年10月首次公布,由OpenAI与博通密切合作开发,OpenAI自家模型也参与了研发过程。公司计划把Jalapeño做成多代平台,让AI产品、模型、芯片和内存协同开发。

这种全栈思路让OpenAI能够针对推理过程中容易产生摩擦的环节做专门优化。Jalapeño特别针对预填充和通信阶段做了延迟最小化设计,OpenAI称这两个环节常常成为推理处理的瓶颈。

OpenAI在发布结果的博客文章中解释,Jalapeño的设计目标是尽量减少数据移动和通信延迟。这意味着模型状态,包括生成响应时使用的KV缓存,可以被明确放置并保持在本地,同时系统为每个推理阶段激活合适的计算、内存和网络组合。

部署节奏:先小批量验证,再逐步放量

从时间线看,Jalapeño距离真正规模化还有一段路。2026年底的小批量部署更像早期验证,2027年才会进入更有意义的落地阶段。OpenAI没有在本次发布中给出具体的客户名单或部署规模数据。

这次基准测试的完整结果已经通过OpenAI官方博客公开,测试环境、对比口径等细节可在原始发布中进一步核对。