公众号记得加星标⭐️,第一时间看推送不会错过。
OpenAI表示,其新款 Jalapeno 芯片在测试中表现优于英伟达公司目前的芯片产品线,凸显了该公司在自主研发 AI 处理器方面取得的进展。
在测试中,Jalapeno处理器在两项指标上领先:单位功耗下可处理的AI工作量以及响应速度。OpenAI芯片负责人Richard Ho周一在接受采访时表示,该半导体芯片的竞争对手是英伟达的GB300,后者是此次测试所用公开基准测试系统中的领先者。
ChatGPT 的开发商计划于今年晚些时候开始使用新型芯片来支持其人工智能模型,这是其构建自有人工智能基础设施的整体战略的一部分。该公司加入了众多致力于开发自主人工智能芯片的公司行列——目前该领域由英伟达主导。
Ho周二在彭博科技节目中表示,随着新芯片的广泛应用,OpenAI 的成本将大幅降低。“这是一款非常优秀的芯片——它应该能大幅降低成本,”他说道。他还表示,只要 OpenAI 能够提高 Jalapeno 芯片的产量,并且成本节约能够达到预期水平,公司就计划使用自主研发的芯片处理更多的人工智能任务。
OpenAI与博通公司合作开发了Jalapeno处理器。博通公司为众多客户定制芯片。两家公司去年宣布了合作协议,并在今年6月盛赞该处理器的开发速度,称其以创纪录的速度完成。
Ho表示,通常情况下,有些芯片更擅长运行人工智能任务,有些则更擅长快速响应,但Jalapeno芯片兼具两者优势。他还说,OpenAI将决定哪些人工智能模型可以在Jalapeno芯片上运行,客户可以根据自身需求选择更经济实惠或性能更优的方案。
“在实验室里,Jalapeno 在高吞吐量领域和低延迟领域都表现出色。高吞吐量意味着它能够以更低的成本服务更多客户,而低延迟意味着对于那些关心延迟的客户来说,响应时间将非常非常快,”Ho 说。
Jalapeno表示,由于该芯片在低电压(700瓦)下取得了强劲的性能,因此可以帮助OpenAI在运行其数据中心时节省资金,而电力是数据中心的一项关键成本。
Jalapeno并未针对刚刚开始出货的新一代英伟达芯片Vera Rubin进行测试。它也并非为训练AI模型而设计,而这正是英伟达技术的强项。Jalapeno的目标应用是AI的推理阶段——即模型已经训练完成,可以开始响应指令并处理任务的阶段。
Jalapeno芯片的速度优势如此显著,以至于OpenAI能够取得以往只有采用不同类型内存和设计的芯片才能实现的成果。例如,OpenAI目前在其部分模型中依赖于Cerebras Systems公司的技术。但Ho表示,这类芯片最适合小型模型。
相比之下,Jalapeno 可以处理更大的目标,他说道。不过,Ho 也表示,OpenAI 的技术短期内不会取代 Cerebras 等供应商。
他说:“我们对计算能力的需求非常大,所以我们才和这么多不同的服务提供商签约。这种情况还会持续一段时间。”
其他初创公司也在研究类似的想法。上周宣布融资后估值达到210亿美元的Etched公司,已经开始出货一款低电压芯片。而由两位谷歌芯片业务前员工创立的MatX公司,正在研发一种旨在同时实现高吞吐量和低延迟的半导体。
OpenAI 公开测试了其新款芯片,测试工具包括其一款较小的开源模型,以及来自 DeepSeek 和 Moonshot AI 的第三方模型。Jalapeno 芯片在 Moonshot 的 Kimi 模型上展现出更显著的优势,Kimi 模型是 OpenAI 测试过的最大模型。在内部测试中,该芯片在运行 OpenAI 一些尚未发布的大型高级模型时也表现出色。该公司在一篇博客文章中表示,这表明该芯片的设计“随着工作负载规模的扩大和要求的提高而变得更有价值”。
OpenAI表示,他们利用自主研发的AI模型加快了芯片的开发速度。第二版芯片的开发工作已接近尾声。Ho表示,公司预计将在“未来几个月”内完成芯片流片——这是设计的最后阶段。
OpenAI 已经在着手设计第三代人工智能技术,该公司希望降低其在全球范围内建设的庞大人工智能基础设施的成本。“我们现在的成本和性能水平已经达到了可以降低基础设施成本的程度,”何先生说。“这是第一步。”
尽管 OpenAI 大力宣传自身成果并将其与英伟达进行比较,但 Ho 仍特意指出,OpenAI 仍然视英伟达为重要的芯片供应商。“英伟达是一个非常好的合作伙伴,我们仍然非常需要英伟达的产品,”他说道。
Jalapeño测试结果,业界领先
自发布 OpenAI 首款定制推理芯片 Jalapeño 以来,我们一直在测试该芯片及其构建的系统。测试结果显示,性能显著提升:Jalapeño 能够在单位功耗下处理更多 AI 任务,同时还能更快地返回响应。Jalapeño 采用单一架构即可实现更高的吞吐量和更低的延迟,而现有硬件系统通常需要在两者之间做出权衡。
对客户而言,这意味着随着需求的增长,他们将获得更快的响应速度、更高效的客服人员以及更可靠的访问。我们的使命是确保通用人工智能造福全人类。这些成果将有助于降低人工智能的性能,使其更加经济实惠,并得到更广泛的应用。
OpenAI 模型也加速了 Jalapeño 的开发。早期的模型帮助团队设计并完成了芯片的开发,而最新的模型则加速了我们对芯片的优化和编程。Jalapeño 的性能在 GPT-OSS 120B、DeepSeek R1 和 Kimi K2.5 1T 上均有体现,表明该架构适用于 OpenAI 内外开发的模型。在这三个平台上,Jalapeño 在峰值吞吐量下每瓦的 AI 工作量是对比系统的 1.5 到 1.9 倍,端到端延迟降低了 1.7 到 3.6 倍。对于高交互性工作负载,其性能更是提升了 2.1 到 4.1 倍。
Jalapeño 也体现了我们更广泛的全栈优势。OpenAI 能够将模型、产品、服务软件、芯片、内存、网络和系统整合在一起,并利用我们从实际工作负载中获得的经验来改进堆栈的每一层。Jalapeño 正在使用第一方芯片进行测试,并取得了可衡量的成果,它标志着一个多代平台的开端。在接下来的几个月里,我们将加速 Jalapeño 的部署,为客户提供速度更快、功能更强大、效率更高的产品。
我们以匹配的用户体验来评估性能,衡量每个系统在满足客户和交互式代理所需的延迟的前提下,单位功耗下能够完成多少有用的AI工作。这一点对于需要按顺序完成多个步骤的代理尤为重要,因为延迟会在整个任务过程中累积。
为了解 Jalapeño 的实际性能,我们使用 SemiAnalysis 的公开基准测试工具 InferenceX 对其进行了测试。InferenceX 能够衡量 AI 请求的完整处理过程。我们将 Jalapeño 与市面上领先的 AI 系统在测试范围内进行了比较,测试范围涵盖了从高吞吐量服务到高交互性、低延迟的应用场景。结果表明,Jalapeño 在吞吐量、能效和延迟方面均表现更佳。虽然有时会以芯片性能作为衡量标准,但我们认为单位功耗性能才是更实用的标准。
Mixed-token 吞吐量与现有加速器的最快解码速度相匹配
在所有三个公开测试模型中,Jalapeño 在测试的运行范围内均实现了更高的每瓦性能和更低的延迟,处于帕累托前沿。为了确保系统间比较的一致性,我们使用每个加速器的芯片额定功率对结果进行了标准化处理。Jalapeño 的额定功率为 700 瓦,但在测试的工作负载下,其持续功耗始终保持在 550 瓦或以下。
Jalapeño 在 GPT-OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T 上均表现出色。在我们测试过的最大公开模型 Kimi 上,其每瓦峰值性能比对比系统高出约 1.5 倍,端到端延迟降低了约 3.4 倍。在我们的内部测试中,Jalapeño 在 OpenAI 的前沿模型上的优势进一步扩大,这表明随着工作负载规模的扩大和要求的提高,该架构的价值也日益凸显。
Jalapeño 从设计之初就围绕着一个核心问题展开:如果硬件的主要任务是服务于现代和未来的语言模型,尤其是交互式代理,那么我们应该构建什么样的硬件?Jalapeño 的优势在于,它围绕着真实的语言模型工作负载,将芯片、内存、网络、软件和机架级系统进行一体化设计。语言模型推理会经历几个不同的阶段,每个阶段都有不同的瓶颈。预填充阶段(系统处理提示信息)计算量巨大,而解码阶段(系统逐个生成响应词元)则更多地受限于内存带宽。通信也会增加延迟,因为数据必须在内核和芯片之间传输,导致一些处理单元在等待期间处于空闲状态。一个在某个阶段表现优异的系统,在等待数据或在不同资源之间传输模型状态时,可能会失去这种优势。
我们设计 Jalapeño 的目的是最大限度地减少数据移动和通信延迟。这意味着模型状态(包括生成响应时使用的键值缓存)可以显式地放置并保存在本地,而系统则针对每个推理阶段激活合适的计算、内存和网络组合。网络是架构不可或缺的一部分。其庞大的域允许整个工作负载保持在一个连接的系统内,从而最大限度地减少数据移动,并确保整个请求从始至终保持快速高效。最终,我们得到了一个平衡且灵活的加速器,它能够支持不断变化的模型架构,在预填充和解码方面都表现出色,并能随着两者之间平衡的变化而进行调整,这是智能体工作负载的一个显著特征。
人工智能在Jalapeño芯片的开发过程中发挥了直接作用,通过探索各种实现方案、缩短设计、测量和验证周期,以及不断迭代模型工作负载,帮助团队在短短九个月内完成了从初始设计到流片的整个过程。人工智能还帮助优化了芯片的算术电路,使团队能够按计划在芯片中集成更多计算性能。
Jalapeño 的设计目标是为人类和人工智能提供一个清晰、可预测的编程目标。工程师可以通过局部张量、显式通信和可预测的同步来描述工作。人工智能随后可以优化这些工作在系统中的映射、放置、调度和协调方式。这种清晰、可预测的结构为人工智能提供了一种可行的方法来解决传统上棘手的并行编程问题。
支持每个新的模型系列仍然需要新的内核和模型特定的优化。利用 Codex 和 GPT-Astra,团队在两个月内将三个原本不在 Jalapeño 最初生产计划中的开源权重模型实现了高性能运行。这既展现了架构的灵活性,也体现了人工智能在编程方面的强大能力。对于选定的 GPT-OSS 注意力机制和混合专家模型模块,人工智能生成的实现比现有的人工专家编写的实现快 1.5 到 1.8 倍。这些数据适用于选定的模块,而非整个模型,但它们表明了一种强大的全新开发循环。
人工智能基础设施的价值在于它能够支持现实世界中的诸多实用工作。Jalapeño 能够利用相同的算力和硬件产出更多有用的成果,从而帮助我们满足更多需求,并降低交付成功成果的成本。对于 OpenAI 而言,这可以提高运营效率,使有用成果和收入的增长速度超过服务成本的增长速度。它还能支持更广泛的应用,并促使人们持续投资于更优秀的模型、产品和基础设施。更快的推理速度可以带来更快的迭代速度和新的应用场景。
Jalapeño 扩展了高效、低延迟推理的可能性:
1、超快速模式推理,其效率此前仅在快速模式下才能达到。
2、快速模式推理的效率达到了以往只有在批处理模式下才能实现的水平
3、批量模式推理效率更高
我们计划在年底前开始在 OpenAI 的计算基础设施中部署 Jalapeño。这是多代路线图的第一代:第二代正在紧锣密鼓地开发中,第三代也正在成型。每一代都将在我们积累的经验基础上,进一步提升效率和速度。
为满足日益增长的人工智能需求,我们需要利用一切可用资源来提升计算能力。我们将继续广泛部署英伟达及其他合作伙伴的加速器,用于训练和推理工作负载。我们的使命是确保通用人工智能造福全人类。
在部署准备阶段,我们正在持续进行生产环境验证,完善软件,为大规模运行 Jalapeño 做好准备,并验证其在更多模型上的性能。目前为止的成果表明,当我们共同设计整个系统时,能够实现怎样的成果:更高效地为更多用户提供响应更迅速、功能更强大、更具智能性的 AI 服务。
(来源:内容来自半导体行业观察综合)
*免责声明:本文由作者原创。文章内容系作者个人观点,半导体行业观察转载仅为了传达一种不同的观点,不代表半导体行业观察对该观点赞同或支持,如果有任何异议,欢迎联系半导体行业观察。
今天是《半导体行业观察》为您分享的第4510期内容,欢迎关注。
加星标⭐️第一时间看推送~
求推荐
热门跟贴