编者按
本文是由摩元智库提供的“不可能三角”系列文章第一篇,其中的产业观点和模型测算源自其AI算力底座系列研报,不代表“半导体行业观察”官方观点。若对相关分析报告感兴趣,可通过文末联系方式跟摩元智库分析师直接交流。
同样以100颗理论裸片为标准化起点,一条交付路径最后可对应 42 份有效算力,另一条只有 15 份,差距接近3倍。
拉开这3倍的,是从晶圆到 Token 之间每一道门的连续折损。它们不是相加,是相乘。
为什么要把视角从单颗 GPU 移向整套系统?可以先看下大摩估算。
摩根士丹利下一代 AI 机架 BOM 估算显示,从 GB300 NVL72 到 VR200 NVL72,整机成本可能接近翻倍;其中内存与存储相关成本增幅约 435%,GPU 在整机 成本中的占比则可能下降。
把它简单读成存储涨价,会漏掉真正的变化。摩元智库的判断是,AI芯片的竞争正在换计量单位:从一颗裸片的峰值,变成一整套系统能不能被封装、点亮、喂饱。
产业链里还流传着另一个数字:2026 年中国AI算力卡需求接近 110 万张。这个口径来自渠道访谈,没有公开机构背书,但它代表了一种很普遍的观念,用卡数衡量算力。
而卡数回答的只是想买多少,离最终能拿到多少还隔着整条交付链。
晶圆投进去,不等于卡能交出来;卡运进机房,也不等于有效算力已经形成。
在一张 AI 算力卡真正开始稳定运行之前,它要连续穿过裸片筛选、后道产能、HBM 匹配、先进封装、最终测试、整机集成、供电散热和软件调度。
任何一环没有跟上,上一环已经投入的晶圆、设备和资本都可能暂时沉淀在途中。
因此,观察国产 AI 芯片竞争,不能只数做出了多少颗芯片,还要看多少芯片最终变成了可以持续运行、稳定生产词元( Token) 的有效算力。
1
GPU没有变轻,系统却变得更重
参数还在涨,但涨的地方变了
过去讨论 AI 芯片,最常见的比较是制程、晶体管、峰值算力和单卡功耗。到了下一代平台,这套比较没有失效,却越来越不完整。
以 NVIDIA Rubin 为例,单颗GPU最高配置 288GB HBM4,带宽最高达到 22TB/s;AMD MI455X 则把单颗 GPU 的 HBM4 容量推到 432GB,带宽最高达到 23.3TB/s。
Google Ironwood TPU 单芯片配置 192GB HBM,带宽约 7.4TB/s,其扩展重点在于把 9216 颗芯片组织成 Pod 级系统。
这些数字指向的其实是另一件事:当计算密度继续上升,真正决定计算单元能否被喂饱的,是 HBM、互连、封装和整套系统的数据搬运能力。
单颗芯片越强,周边系统越不能弱。
增量价值正在向系统环节外溢
摩根士丹利口径中的内存与存储,既包括封装内的HBM,也包括 LPDDR5X、SSD 等机架级配置。GPU 仍然是下一代 AI 机架的核心,但增量价值正在更快流向内存、存储、互连、封装和供电。
这意味着,下一轮竞争的题目已经变了:从谁能设计出更快的芯片,变成谁能把计算、访存、封装、供电和软件组织成一套可规模交付的系统。木桶效应开始出现。
一颗峰值很高却长期等不到HBM、封装或机房电力的芯片,不会自动变成收入,也不会自动变成 Token。
2
不可能三角落地:晶圆之后的三道门
功耗、访存与流片良率,听起来像三个分散的技术话题。放到真实交付链里,它们分别对应晶圆之后必须穿过的三道门。
第一扇门:制造门,流片与良率
先进逻辑芯片首先受到光罩场和缺陷密度的物理约束。在常见单次曝光条件下,光罩场上限约为 26×33 毫米,也就是约 858mm²。裸片越接近这一尺度,同一片晶圆能够切出的理论数量越少,对缺陷也越敏感。
Chiplet 和多裸片设计提供了一条重要出路:把不同功能拆到更合适的工艺和裸片上,再通过先进封装重新组合。
它可以改善单颗大裸片的制造经济性,却不会让良率问题消失,是把问题从一个裸片能否做成,扩展为多颗已知良品裸片、I/O 裸片、HBM 与中介层能否共同通过封装和测试。
这有点像组装一块拼图:每片都单独验过货,可拼的时候每一次对位都得成。片数越多,一次拼成的概率就越低。
因此,晶圆厂总产能与先进 AI 芯片的可交付量之间,还隔着节点、产品、大裸片良率和封装测试等多层变量。公开财报通常披露全公司的等效产能和利用率,无法直接回答某个先进节点或某款大裸片究竟能产出多少。
总产能扩大,也不等于特定 AI 芯片的交付量会同比例放大。
第二扇门:资源门,HBM与访存
一颗合格的逻辑裸片,只有匹配到规格合适、时间同步的 HBM,才有机会进入下一步封装。HBM 代际、堆叠层数、基础裸片、测试认证和客户分配任何一项变化,都可能影响最终节奏。
先进封装也是同一扇门的一部分。TrendForce 援引产业消息称,市场估计台积电 CoWoS 月产能在 2026 年可能达到约 12 万至 14 万片晶圆,供需缺口有望逐步收窄。
但扩产解决的是总量,解决不了谁能在需要的时间拿到匹配产能。封装类型、产品验证、基板、测试设备和客户分配仍然决定真实兑现率。
这一步有点像春运:票买到了不算数,还要车站有站台、调度有车次、行李能同车走,几件事必须在同一天、同一个站台对齐。缺任何一环,票攥在手里也上不了车。
真正稀缺的并不只是某一种材料或某一段产能,而是资源会合,前道产出的合格裸片,能否与 HBM、基板、封装设备和测试能力在正确的时间、正确的地点匹配起来。
第三扇门:基础设施门,功耗与能效
芯片完成封装测试后,还要面对机架供电、液冷、网络和整机点亮。
NVIDIA 已提出面向 2027 年的 800VDC 供电架构,用于支持从 100kW 向 1MW 以上演进的高密度机架。这条路径通过减少配电层级,降低铜材、电源模块和空间占用,让更多电力抵达计算单元。
这有点像把楼里的分级配电改成从变电站直供:中间少几级转换,送到用电端的电就多几分。代价是整栋楼的线路都得重排。
在百千瓦级高密度机架中,液冷正由可选项转向主流工程路径。机房能否提供电力、冷却和并网条件,会直接决定一批芯片能否在目标时间内上电。
至此,不可能三角落到了同一条交付链上:制造门对应流片与良率,资源门对应 HBM 与访存,基础设施门对应功耗与能效。
更高带宽往往带来更复杂的封装与供电;更多裸片和更大系统,又会增加测试、互连和散热压力。三者互相牵制,最终共同决定有效交付。
图 1|不可能三角,落在同一条交付链上。资料来源:摩元智库研究框架。
3
从约1.8倍到近3倍:
差距是在每一道门里乘出来的
先看一个最简单的乘法
假设交付链上五个关键环节的兑现率都是 90%,连乘之后还剩多少?
90% × 90% × 90% × 90% × 90% ≈ 59%
就像连着打五次九折,最后拿到手的不是九折,而是接近六折。
某一道门突然归零,反而是看得见的风险。真正吃掉产出的,是每道门都还过得去,但连着乘了五次。
两条路径,同一个起点
摩元智库把交付过程拆成两个模块:前半段算制造供给,后半段算投运效率。把理论裸片起点统一标准化为 100,两条路径是这样走完全程的。
协同较顺100 → 合格裸片(KGD)率、后道资源兑现率、HBM 匹配率、先进封装通过率、最终测试通过率 → 可交付卡指数55→ 整机集成、按期上电、单卡吞吐、运行可用率、工作负载效率 → 最终42 份相对有效算力
多点承压100 → 同样这十道环节,每道的兑现率都低一档 → 可交付卡指数31→ 继续折损 → 最终15 份相对有效算力
可交付卡指数的差距约为 1.8 倍;走到链路终点,相对有效算力的差距被放大到接近 3 倍。
面对同样的理论裸片起点,一条路径最终形成的有效算力可能接近另一条的三倍——差别不在任何单一工序,而在多个环节的差距连续相乘。
图 2|同样 100 颗裸片,两条路径最后差了近三倍。注:100 为理论毛裸片的规范化起点;42 和 15 为相对有效算力指数,不对应具体企业,也不是市场预测。资料来源:摩元智库情景模型。
为什么有多少卡越来越难代表真实能力
敏感性测试进一步显示,前道良率、后道兑现、HBM/封装和软件运行效率处在同一条乘法链上;任何一项掉队,都会吃掉其他环节已经投入的资源。
同样数量的晶圆,可能对应完全不同的合格裸片和成品数量;同样数量的成品卡,可能因为 HBM、供电和整机条件形成不同的上电节奏;同样数量的已点亮卡,还会因为网络、并行策略和工作负载,产生不同的有效吞吐。
最后这一层最容易被忽略:同样一条高速公路,有人跑满载货运,有人空车来回——路一样宽,产出天差地别。
从晶圆到 Token,中间没有任何一步是自动完成的。
4
2027不是开奖年,
而是交付能力的兑现窗口
真正的交割发生在发布之前
2027 年之所以值得关注,是因为多个此前投入的变量可能在这一阶段集中兑现:下一代 GPU 与 ASIC 进入部署周期,机架功率向兆瓦级演进,国内芯片、封装、存储和系统厂商也在经历新的工程学习曲线。
但2027年能交出多少,取决于此刻已经锁定的产能,后道尤其如此,它的排期通常提前一年以上。
TrendForce 预计,全球2.5D封装的紧张状况将到 2027 年开始缓解,台积电计划到 2027 年把 CoWoS 产能扩张六成以上。
这也是为什么真正的黄金交割发生在产品发布之前。晶圆、HBM、封装验证、基板、供电设备和数据中心建设都需要提前安排;等到一款芯片发布再去寻找全部资源,通常已经太晚。
三条可以放大的突围路线
对国产AI芯片而言,这组物理约束也是一条可以被工程协同放大的突围路线。
一是在制造端减少折损。用Chiplet和更合理的 I/O 分工,把有限的先进工艺用在最需要的位置,并把封装与测试的协同前移。
二是在访存端把资源协同前置到产品定义。HBM 规格、封装路线、基板和系统形态越早对齐,越能避免问题被推迟到最昂贵的阶段才暴露。
三是在功耗端推进算电协同。能否按期上电、稳定运行并持续输出,本身就是芯片竞争力的一部分。
系统级优化不能代替先进工艺,但它能把每一片稀缺晶圆、每一组HBM和每一瓦电力转化为更多有效产出。衡量突围的尺度,也应当从有没有一颗芯片,升级为有没有一套能复制、能部署、能稳定运行的交付体系。
结语:卡数只是起点
回到开头那个问题:同样 100 颗理论裸片,为什么两条路径最后差了近3倍?
对于国产 AI 芯片,流片良率决定合格裸片从哪里来,HBM 与先进封装决定它能否变成完整的计算器件,供电与散热决定它能否持续运行。
功耗、访存和良率不是三个孤立问题,而是 AI 算力底座的同一个交付问题。答案不在某一道门里,而在整条链能不能少打折。
这不只是芯片公司要回答的问题,也是中国 AI 算力要回答的问题。
本文摘自摩元智库AI 算力底座系列研究;完整研究将进一步拆解参数、情景与工程优先级等。
摩元智库将在上海-深圳-北京-成都四个城市举办AI芯片-服务器-智算中心产业链分析研讨会,欢迎感兴趣的半导体行业人士和投资人报名参会。
*本文为产业研究内容,不构成投资建议。文中摩元智库模型结果为规范化情景测算,不对应具体企业,也不是市场预测。
参考资料
1. Morgan Stanley,AI 服务器机架 BOM 与供应链研究,2026 年 5 月。
2. NVIDIA,Vera Rubin Platform 官方技术资料。
https://www.nvidia.com/en-us/data-center/technologies/rubin/
3. AMD,Instinct MI455X 与 Helios 官方产品资料。
https://www.amd.com/en/products/rackscale-solutions/helios.html
4. Google Cloud,Ironwood(TPU7x)官方技术文档。
https://docs.cloud.google.com/tpu/docs/tpu7x
5. TrendForce,台积电先进封装扩产与 CoWoS 供需报道,2026 年 6 月。
https://www.trendforce.com/news/2026/06/15/news-tsmc-cowos-supply-demand-gap-reportedly-seen-narrowing-from-20-to-10-by-end-2026-as-capacity-expands/
6. NVIDIA,800 VDC Architecture for AI Factories。
https://www.nvidia.com/en-us/data-center/technologies/800-vdc-architecture/
*免责声明:本文由作者原创。文章内容系作者个人观点,半导体行业观察转载仅为了传达一种不同的观点,不代表半导体行业观察对该观点赞同或支持,如果有任何异议,欢迎联系半导体行业观察。
今天是《半导体行业观察》为您分享的第4499内容,欢迎关注。
加星标⭐️第一时间看推送
求推荐
热门跟贴