作者|青苹吹果
编辑|无心插柳柳橙汁
Open AI的第一枚自研芯片造出来了。
前不久,Open AI在社交平台上晒出了一张图,画面里Sam Altman从博通CEO陈福阳手里接过了一片晶圆。
不是PPT,也不是概念图,是一颗已经在实验室里跑通了真实模型的工程样片。
它的名字叫Jalapeño,是Open AI从头设计的第一颗AI推理芯片,专治AI推理太贵、太慢、太耗电。
九个月前,它还只是一张白纸。而九个月后,它已经能在实验室里稳稳跑通GPT-5.3-Codex-Spark这样的模型,频率和功耗全部达标。
更离谱的是,帮它加速设计的,就是Open AI自己家的模型。
自己养的AI,帮自己造了副新“身体”?
不仅如此,这副新身体,还要用来跑更聪明的下一代AI,你用的ChatGPT、Codex,正在反过来帮它们自己打造下一代要跑的硬件。
我有种预感,这个飞轮一旦转起来,很多东西要被重写。
九个月
行业纪录被碾碎
经常造芯片的朋友们都知道,一颗高性能ASIC(专用集成电路),从定架构到交给工厂流片,常规周期是两到三年。
Google第一代TPU从架构到流片花了大约三年,传统芯片公司同等规模的项目动辄五到七年。
Open AI只用了九个月。
这速度,堪比芯片界的“特种兵极限越野”,被称之为“高性能先进半导体领域有史以来最快的ASIC开发周期”。这还真不是吹牛。
怎么做到的?两个原因,一个靠“脑力”,一个靠“体力”。
第一,AI帮自己画电路图,把验证的死循环跑成了“快进模式”。
芯片设计最折磨人的环节不是设计架构,而是设计完之后成千上万次验证、修改、再验证的死循环。这部分在项目周期里往往要占掉大半时间。
而AI恰好擅长干这种“暴力枚举”的脏活累活。
Open AI没有披露具体细节,但明确提到,他们用自家模型加速了设计和优化的部分流程。
这画面就有点科幻了,AI帮自己画电路图,电路图变成芯片,芯片跑出更强的AI,更强的AI再去画下一代芯片。
形成了一个自己给自己“递扳手”的闭环,速度能不快吗?
实验室里的工程样片已经在跑了,跑的是GPT‑5.3‑Codex‑Spark这类前沿模型,频率和功耗全部达到量产目标。
第二,挖来了专业团队,让最懂敲代码的人,反过来教芯片怎么跑代码。
Open AI硬件团队的掌门人Richard Ho,曾在谷歌做了九年TPU芯片工程,最高做到高级工程总监。
他那段时间参与发明的机器学习辅助芯片设计方法,让多个TPU项目第一次流片就成功了。之后他又去光子计算公司Lightmatter待过,几乎把“AI硬件”这条路上每个关键节点都踩了一遍。
2023年底他加入Open AI,迅速拉起了一支约40人的精锐部队。
一个懂LLM运行规律的人,带着一帮懂LLM运行规律的模型,去设计专门跑LLM的硬件,完全就是对症下药!
但有个问题:流片成功,就等于量产无忧吗?
当然不是。
流片只是把设计送去制造,距离大规模量产还有良率、供应链、软件生态一堆坎要迈。
但九个月能把一张白纸变成一块能跑的硅片,这个节奏本身已经够让人咂舌了。
为什么不碰“训练”
专攻“推理”?
Jalapeño有个很明确的定位:只做推理,不搞训练。
训练和推理,对芯片的要求完全是两码事。
训练,是教模型“读书认字”的阶段。你得把全网的公开资料、书籍、代码一股脑塞给它,让它从海量数据里自己摸索出规律。
这个过程需要极其恐怖的算力密度,以及海量的高带宽内存来喂数据,而且对通用计算能力要求极高。
在这个领域,英伟达的GPU凭借CUDA生态和硬件架构,筑起了一道几乎无法逾越的护城河,短期内谁也撬不动。
推理就不一样了,推理是模型“答题”的阶段。
你打开ChatGPT敲下一行字,点击发送,服务器那头在几秒钟之内生成回答并传回给你,这就是推理。
推理任务的特点是:模型已经定型了,不需要再学新东西,只需要在既定框架下快速、低成本地处理海量用户请求。
这种工作,最适合用专用芯片来做精准优化,把每一瓦电、每一分钱都榨出最大价值。
Open AI选择从推理侧下场造芯,是一个相当务实的决策。
为什么这么说?因为很多人没意识到,推理正在悄悄取代训练,成为算力消耗的头号大户。
行业里的主流模型,推理端消耗的算力已经逐渐超过了训练端。
训练模型像盖一栋大楼,图纸画完、主体封顶,钱一次性花出去了,后面就不用再掏了。但推理呢?大楼盖好之后,每天开门营业,空调、电梯、照明、维护,每一秒都在往外掏钱,只要还有用户在问ChatGPT,这钱就停不下来。
换句话说讲,训练是“首付”,推理是“月供”,月供可是要还一辈子的。
对于ChatGPT这种用户量以亿为单位的产品来说,推理成本如果一直居高不下,盈利就永远是一笔算不过来的账。
用户越多,回答问题越勤快,算力账单就越滚越大,收入还没捂热就被成本吃掉了。
Jalapeño就是冲着这个死穴来的。
博通CEO陈福阳透露,跟市面上主流的AI图形处理单元相比,Jalapeño能把推理成本砍掉接近一半。
原来处理一次请求花两毛,现在一毛出头就够了。省下来的全是利润空间。
不止成本,性能方面的消息也很炸。
早期测试显示,Jalapeño的每瓦性能“大幅优于当前业界最先进水平”。陈福阳在接受路透社采访时甚至放话说,这颗芯片的表现足以和英伟达Blackwell、Google TPU掰手腕。
不过,目前这些数字都是官方自己说的,还没有第三方独立实验室跑过基准测试。
官方喊“媲美Blackwell”,具体是在什么模型上测的、什么并发条件下跑的、跟Blackwell的哪个配置比的,这些细节都得等技术报告正式发布才能见分晓。
但这不妨碍我们先兴奋一下。
Open AI的“全栈”野心
不只是造颗芯片
Jalapeño意为墨西哥辣椒,属于辣度最温和的品种。
起这个名字,其实也是Open AI在暗示:Jalapeño只是第一步,以后面还有更“辣”的。
以前Open AI的活法很简单:只管专心搞模型,至于算力和数据中心,全丢给微软和英伟达去头疼。
这让他们在早期的模型军备竞赛里跑得飞快,但也埋下一个结构性隐患——算力成本的定价权,不攥在自己手里。
命门在别人手上,交租得看房东脸色。
而Open AI今天面对的竞争环境,已经和两三年前完全不同了。
在过去,模型能力是最大的竞争变量,只要能把模型做得更聪明,算力贵一点还能忍。但进入Agent、AI编程、AI视频等新阶段后,模型能力正在逐渐趋同,真正拉开差距的,开始变成谁能以更低的成本、更大的规模,把智能战力持续送到用户手里。
换句话说,AI竞争正在从“谁模型最好”转向“谁交付智能的效率最高”。而推理芯片,恰恰就是决定这种效率的底层基础设施。
2025年秋天之后,Open AI的动作明显变了节奏。
先是和博通宣布合作搞自研加速器,紧接着跟英伟达签了千亿美元级别的数据中心协议,又和AMD锁定了6GW的芯片供应,2026年6月还跟Cerebras谈下了750MW的推理算力订单。
加上这次Jalapeño芯片正式亮相,四条路线齐头并进:
自研芯片、英伟达、AMD、Cerebras。
现在看,你还会觉得Open AI是一家单纯“做模型的公司”吗?
显然不会了。
从更长远来看,自研芯片的意义,甚至不只是节省成本。
AI行业正在进入一个新的竞争阶段:模型、芯片、网络、数据中心、软件栈开始越来越紧密地耦合在一起。未来真正领先的AI公司,比拼的可能不再只是某一个模型,而是整套基础设施是否能够协同优化。
就像苹果通过自研M系列芯片,把硬件、操作系统和应用生态整合成一个整体一样,Open AI也正在尝试把模型、推理系统和底层硬件一起设计。这意味着,它希望优化的不只是某一个模型,而是整个AI服务链路。
而且Open AI的IPO筹备正在路上。在这个节点上推出自研芯片,就是在非常明确的向投资市场传递信号:这家公司有办法、有计划把推理成本这个最大的出血点给堵上。
财务叙事和技术叙事在此汇合。
合作模式上,Open AI选了一条务实路线。
芯片架构、内核优化、服务系统由自己主导;硅实现和网络互联交给博通(谷歌TPU就是通过博通量产的,这条路已经跑通过);板卡、机架和系统集成则交给了加拿大的Celestica,顺带一提,这家公司同样是谷歌TPU的首选制造伙伴。
三家拼起了一张完整的拼图。
博通CEO陈福阳把这次合作称为“一项根本性承诺”,不是一次性项目,而是一个多代际路线图的起点。
Jalapeño只是开始,根据此前媒体报道,第二代芯片的代号叫“Serrano”,同样是一种辣椒。
部署时间线也定了,2026年底开始初步部署,之后逐年扩展,最终目标是和微软等合作伙伴一起,建设吉瓦(GW)级别的数据中心。
吉瓦是什么概念?
大约相当于整个北京市的居民用电量。这种量级的电力调度,本身就是一种基础设施建设能力的终极压力测试。
Open AI正在从一家AI实验室,蜕变成一家全栈AI公司。
模型自己训,芯片自己设计,推理自己优化,部署自己控制。
你的ChatGPT账单
正在被重写
说了这么多,这些跟我们普通人有什么关系?
关系大了,以后我们用的AI将会越来越“物美价廉”。
Greg Brockman在发布时说过:“世界正在转向一个由算力驱动的经济。”
这话听着大,但细想不虚。
无论是学生想借助AI理解一篇论文,还是小企业用API搭建一个客服系统,又或者独立开发者靠代码助手完成一个项目,背后都是算力在悄悄做功。
而算力成本的高低,直接决定了这些东西是少数人的工具,还是多数人的日常。
Open AI把Jalapeño定位在推理侧,本质上是在做一件事:让智能变得更便宜、更快、更稳定。
每次推理延迟少一秒,每个API调用价格降一分,落到每一个普通人那里,就是能用更少的钱,更顺畅地使用AI,甚至用上那些今天还只属于大企业和付费用户的高级能力。
打个比方,你以前每月花钱订阅,请回来的就是个能陪你侃大山的“高级AI陪聊”。但到了明年,同样的价钱,你请回来的可能是个能帮你把整份PPT做完、顺便把Excel表也清理了的“全能实习生”。
价格没变,但“打工人”的段位飙升了好几级,加量不加价。
当然,不只是花钱的用户。当算力变得跟水电一样便宜,曾经只有大厂才烧得起“最强大脑”,以后可能就变成每个人随手就能用的标配工具。
回过头来看整件事,最妙的其实是这个循环:
AI设计芯片 → 芯片跑AI → 更强的AI设计下一代芯片。
更好的基础设施→更高的算力效率→更好的训练和服务→更强的模型→更好的产品→更多用户和收入→再投入下一代基础设施。
这个飞轮一旦转起来,就是自我加速的。
Google有TPU,Amazon有Trainium,Meta有MTIA,微软有Maia。OpenAI现在也有Jalapeño了。
大模型公司造芯片,正在从“要不要”变成“能不能”的问题。
当然,从流片到大规模量产,中间还有良率、供应链、软件生态等一系列问题要解决。
要知道,英伟达那个CUDA平台,就像是AI界的“通用语言”或“水电网络”,大家用了十几年,早就习惯成自然了。现在你想让所有人换套新系统?那难度不亚于让全国司机一夜之间改靠左行驶。
再看看前面的老大哥:谷歌的TPU打磨了十年才有今天,亚马逊的Inferentia也是踩了无数个坑、迭代了好几轮才敢大规模铺开。
Open AI想凭一颗“辣椒”就一步登天?路还长着呢。
但Jalapeño的出世至少证明了一件事:AI不仅能帮人干活,还能帮自己造“身体” 。
用最懂LLM的模型,设计最跑LLM的硬件,一旦这个循环跑起来,那个“算力更便宜、AI更普及”的未来,将会加速到来。
热门跟贴