过去很多年,半导体行业有一个很简单、也很有效的判断方法:

看芯片,先看制程。

7nm 比 14nm 先进,5nm 比 7nm 先进,3nm 又比 5nm 更先进。这个逻辑在 PC、手机和早期服务器芯片时代非常好用。因为那时候,制程节点往往能直接转化为晶体管密度、功耗、频率和成本优势。

但到了 AI 芯片时代,这个判断方法开始不够用了。

不是说制程节点不重要。先进制程仍然是高端 AI 芯片的底层能力。没有先进制程,就很难做出足够高密度、足够高能效的计算核心。

但如果今天还只盯着“这颗 AI 芯片是 5nm 还是 4nm,是 7nm 还是 3nm”,就很容易看错产业竞争的重点。

因为 AI 芯片已经不是单颗芯片的比赛,而是系统能力的比赛。

一颗 AI 芯片能不能真正跑出性能,不只取决于制程节点,还取决于架构、HBM、先进封装、互联、供电、散热、软件生态和数据中心部署能力。

换句话说,AI 芯片的关键问题已经从“这颗芯片有多先进”,变成了“这套算力系统能不能稳定、高效、低成本地输出 token”。

一、制程节点很重要,但它不是完整答案

我们先把话说清楚。

先进制程仍然重要。

AI GPU、AI 加速器、高性能 CPU 都需要大量晶体管。制程越先进,单位面积可以放入更多晶体管,计算密度和能效通常也会更好。

所以,高端 AI 芯片公司仍然会争夺先进制程产能。台积电、三星、英特尔的先进制程能力,仍然是高性能计算芯片的核心基础。

但问题是,制程节点只能回答一部分问题。

它能回答:计算核心能做多密?

它不能完整回答:数据能不能喂上来?显存够不够?芯片之间连得快不快?系统功耗压不压得住?整机柜能不能交付?软件生态能不能跑起来?客户能不能用得起?

这就像看一辆赛车。

发动机当然重要。但一辆车能不能赢比赛,不只看发动机排量。还要看变速箱、轮胎、底盘、空气动力学、燃油系统、刹车、车手和维修团队。

AI 芯片也是一样。

制程节点是发动机能力的一部分,但不是整车能力。

二、AI 芯片真正怕的,不是算力不够,而是数据喂不饱

很多人看 AI 芯片,第一眼看算力。

多少 TFLOPS,多少 TOPS,支持 FP16、BF16、FP8,甚至 FP4。

这些指标当然有意义。但在大模型时代,算力不是唯一瓶颈。

AI 训练和推理的本质,是大量矩阵计算和大量数据搬运。GPU 里的计算单元很强,但它们必须持续拿到模型参数、激活值、中间结果和 KV Cache。

如果数据供应不上,计算单元就会等待。

这就像一个工厂。GPU 是工人,HBM 是仓库,互联是传送带。工人再多,如果仓库太小,传送带太窄,原材料送不过来,工厂产能照样上不去。

这就是为什么今天看 AI 芯片,不能只看制程节点,还要看 HBM。

HBM 的意义不是“更高级的显存”这么简单。它是 AI 芯片的数据供给系统。它决定模型参数能不能放得下,数据能不能快速送到计算核心旁边,推理响应能不能更快,GPU 利用率能不能提高。

特别是在长上下文、多模态、Agent 和 reasoning 模型兴起之后,推理阶段对显存容量和内存带宽的压力越来越大。

所以,高端 AI 加速器的竞争,已经从“谁的计算核心更强”,扩展到“谁的计算核心、HBM 容量、内存带宽和数据搬运效率更均衡”。

这就是为什么 HBM 变成了 AI 芯片的命门。

三、先进封装决定 GPU 和 HBM 能不能真正协同

HBM 很重要,但 HBM 不能孤立存在。

HBM 必须靠近 GPU,才能发挥高带宽和低功耗优势。

问题是,GPU 和 HBM 不是简单放在一块电路板上就行。它们之间需要极高密度、极低延迟、低功耗的互联。这时,先进封装就成了关键。

先进封装不是“把芯片封个壳”。

在 AI 芯片里,它更像是在芯片内部修高速公路。

GPU 是计算中心,HBM 是高速仓库,Chiplet 是不同功能区,硅中介层、RDL、TSV、微凸点和封装基板就是道路、桥梁和地基。

如果道路太窄,数据堵在路上,再先进的 GPU 也跑不满。

如果道路太长,数据搬运功耗太高,系统能效就会下降。

如果封装良率不稳定,芯片成本和交付节奏都会受影响。

所以,先进封装直接决定 AI 芯片能不能把计算、内存和互联组织成一个高性能系统。

这就是为什么 CoWoS、2.5D 封装、3D 封装、SoIC、Chiplet 这些技术变得越来越重要。

它们不是封装行业自己的热词,而是 AI 芯片性能释放的基础设施。

四、Chiplet 让“几纳米”这个问题变得更复杂

过去我们看芯片,问一句“它是几纳米”还比较直接。

但 Chiplet 时代,这个问题变复杂了。

一颗 AI 加速器可能不是一整颗单片芯片,而是由多个 Die 组成。计算 Die 可能用先进制程,I/O Die 可能用成熟制程,HBM 是存储芯片,基板和中介层又属于封装系统。

这时你问“这颗芯片是几纳米”,答案就不再简单。

因为它可能是多种制程、多种芯片、多种封装技术组合出来的系统产品。

这正是 Chiplet 的价值。

它允许芯片公司把最需要先进制程的模块放在先进节点上,把不需要最先进制程的模块放在更成熟、更经济的节点上。这样可以改善成本、良率和设计灵活性。

但 Chiplet 也带来一个新问题:

拆开之后,必须高效连回去。

如果互联慢、延迟高、功耗大,Chiplet 就会变成一堆被拆散的小芯片。

所以 Chiplet 必须和先进封装一起看。

没有先进封装,Chiplet 很难成为高性能计算的有效路线。

五、AI 芯片不是参数表竞争,而是系统 TCO 竞争

AI 芯片最终卖给谁?

卖给云厂商,卖给数据中心,卖给模型公司,卖给需要部署 AI 应用的企业。

这些客户真正关心的,不只是单卡参数,而是总拥有成本,也就是 TCO。

他们会问:

同样的模型,谁的吞吐更高?

同样的推理请求,谁的延迟更低?

同样的 token 输出,谁的电费更低?

同样的机柜空间,谁能部署更多算力?

同样的预算,谁能带来更快回本?

这时,制程节点只是影响 TCO 的一个因素。

HBM 容量会影响模型部署效率。

内存带宽会影响 GPU 利用率。

互联能力会影响多卡训练和推理扩展。

供电效率会影响电费。

散热能力会影响稳定性和机柜密度。

软件生态会影响模型迁移成本和开发效率。

如果一颗芯片制程很先进,但软件不好用,系统不稳定,内存不足,集群扩展差,客户未必愿意大规模采购。

反过来,如果一套系统能稳定运行主流模型,生态成熟,成本可控,交付能力强,即使单看某个制程指标不是最激进,它也可能有很强的商业竞争力。

六、为什么 NVIDIA 的强大不能只用制程解释?

NVIDIA 的成功当然离不开先进制程。

但如果只用“制程先进”解释 NVIDIA 的优势,就把问题看浅了。

NVIDIA 的真正壁垒,是一个完整系统。

GPU 架构、Tensor Core、HBM、NVLink、NVSwitch、CUDA、软件库、整机柜方案、网络系统、开发者生态和客户部署经验,构成了一个闭环。

这套闭环的价值在于,它降低了客户使用 AI 算力的难度,也提高了大规模部署的确定性。

换句话说,NVIDIA 卖的越来越不是单颗 GPU,而是 AI 基础设施。

所以,挑战 NVIDIA 也不是只要做出一颗“同样纳米节点”的芯片就够了。

还要解决:

软件能不能迁移?

模型能不能高效跑?

多卡互联能不能扩展?

HBM 供应是否稳定?

封装产能能否保障?

服务器系统能否交付?

数据中心运维能否稳定?

这就是 AI 芯片竞争真正难的地方。

七、国产 AI 芯片更不能只看制程节点

对国产 AI 芯片来说,“不能只看制程节点”尤其重要。

如果简单用制程节点比较,很容易得出粗糙结论。

比如某颗芯片制程落后,就认为没有机会。或者某颗芯片参数接近,就认为已经追上。这两种判断都不准确。

国产 AI 芯片要真正进入数据中心,需要看更多指标:

第一,能不能稳定运行主流模型。

第二,能不能支持主流框架和算子。

第三,能不能形成可用的软件栈。

第四,能不能解决显存容量和带宽问题。

第五,能不能在服务器和集群中稳定工作。

第六,能不能形成规模化交付和客户验证。

第七,能不能把单位 token 成本降下来。

制程节点只是起点,不是终点。

国产 AI 芯片的机会,也不一定只在追逐最先进节点。推理场景、行业模型、本地部署、专用加速、系统优化、国产服务器适配,都是可能突破的方向。

但前提是,不能把 AI 芯片当成单颗芯片卖。必须把它当成系统工程做。

八、今天看 AI 芯片,应该看哪几个问题?

如果不只看制程节点,那应该看什么?

可以看八个问题。

第一,看架构。

它适合训练,还是适合推理?适合通用大模型,还是适合特定场景?

第二,看内存。

HBM 容量多大?带宽多高?能否支撑长上下文和大模型推理?

第三,看封装。

GPU、HBM、Chiplet 之间怎么连接?封装良率和产能是否可靠?

第四,看互联。

单机内多卡如何通信?跨服务器如何扩展?带宽、延迟和网络稳定性如何?

第五,看功耗。

单卡功耗、整机功耗、机柜功耗如何?每 token 能耗是否有优势?

第六,看散热。

风冷能不能撑住?是否需要液冷?高密度部署是否稳定?

第七,看软件。

编译器、驱动、框架、算子库、模型适配是否成熟?

第八,看交付。

能不能量产?能不能拿到 HBM 和封装产能?能不能装进服务器并交付给客户?

这些问题加起来,才是 AI 芯片的真实竞争力。

九、最后的判断

今天看 AI 芯片,为什么不能只看制程节点?

因为 AI 芯片已经从“单芯片性能竞争”,进入“系统级算力竞争”。

制程节点决定计算核心的起点。

但 HBM 决定数据能不能喂上来。

先进封装决定 GPU、HBM 和 Chiplet 能不能高效协同。

互联决定多卡和多机能不能扩展。

供电和散热决定系统能不能长期稳定运行。

软件生态决定客户能不能真正用起来。

量产交付决定参数能不能变成收入。

所以,先进制程是必要条件,但不是充分条件。

真正强大的 AI 芯片,不是参数表里最漂亮的芯片,而是能在数据中心里稳定跑模型、持续出 token、成本可控、规模可复制的算力系统。

以后分析 AI 芯片,不要只问:

它是几纳米?

还要问:

它有多少 HBM?

带宽够不够?

封装路线是什么?

互联怎么做?

功耗怎么压?

散热怎么解决?

软件生态能不能跑?

客户能不能大规模部署?

谁能回答这些问题,谁才真正看懂了 AI 芯片竞争的下半场。

制程节点仍然重要。

但 AI 时代的芯片战争,已经不再由制程节点单独决定。

如果文章对您有帮助,请酌情给博主打赏。博主联系方式(加V:tigerchip)