OpenAI公布了自研Jalapeño芯片用于AI推理的首批性能数据。根据TestingCatalog在X平台发布的消息,这组数据覆盖三项关键指标:每瓦AI工作量、端到端延迟,以及高交互负载下的整体性能。

具体来看,在InferenceX平台上对三个公开模型进行测试后,Jalapeño每瓦可完成的AI工作量提升1.5至1.9倍,端到端延迟降低1.7至3.6倍,高交互负载下的性能提升幅度达到2.1至4.1倍

打开网易新闻 查看精彩图片

为什么先看每瓦效率

这组数据最先强调的不是绝对算力,而是能效。每瓦AI工作量提升1.5至1.9倍,意味着在相同功耗下可以完成更多推理任务。对于大规模部署推理服务的场景,电力成本直接决定单位推理成本。

端到端延迟降低1.7至3.6倍,指向的是用户体验层面的改善。延迟越低,模型响应越快,在对话、代码补全、实时交互等场景中感知差异会非常明显。

高交互负载下的表现

第三项数据聚焦高交互负载,性能提升2.1至4.1倍。这类负载通常涉及频繁的请求响应切换,对芯片的调度和吞吐能力要求更高。Jalapeño在这类场景下的提升幅度最大,说明设计重点可能放在真实推理服务而非离线批处理上。

TestingCatalog在转发时表示期待看到这款芯片实际部署。OpenAI方面也提到,近期有投资者询问推理芯片创业公司的情况,他们的回答是:在形成判断之前需要真实的性能数据,而这次公布的就是自己的数据。

数据背后的信号

OpenAI选择在InferenceX平台上用三个公开模型进行测试,而不是只展示内部模型的结果。这种做法让数据具备一定的可比较基础,也回应了此前关于推理芯片缺乏公开基准的讨论。

目前公布的是首批性能结果,尚未涉及具体部署时间表或商用计划。Jalapeño能否从测试数据走向大规模落地,还需要后续的实际部署表现来验证。