01
七个机柜 vs 一百六十个机柜
前两天看了一个关于华为昇腾超节点的技术解析。
同样是提供约 8 EFLOPS 的算力,英伟达的方案只要7 个机柜,华为要160 个。差了二十多倍。
第一眼的直觉是——这差距也太大了。但再往下看,发现事情没那么简单。
7台独立计算机
vs
1台超级计算机
英伟达那 7 个机柜,本质上是 7 台独立的机器,靠高速网络连在一起。而华为的 160 个机柜,是一整台超级计算机——几千颗芯片用光互联焊成了一个整体。
两条完全不同的技术路线,背后是两种完全不同的约束条件。
同样算力下,7 机柜 vs 160 机柜的视觉对比
02
单颗不够,数量来补
华为为什么要搞这么大规模?答案其实很现实。
在先进制程和 HBM 供应受限的情况下,单颗昇腾芯片的性能和英伟达顶尖产品之间有差距。这个差距短时间内靠芯片本身追不上。
所以华为选了另一条路——
单颗芯片打不过,就用一千颗、一万颗一起打。
听上去很直接,但真要把几千颗芯片连成一台能用的超级计算机,难度一点不比做单颗芯片小。至少有三道坎要过:
距离问题芯片分散在几百个机柜里,传统铜缆传不了那么远、那么快可靠性问题连接数量指数级增长,断一条线会不会让整个系统瘫痪能耗问题芯片多、连接多,电老虎一样的功耗怎么扛
华为用了三代产品,依次解决了这三个问题。
03
三代演进,一步一个坎
从 CloudMatrix 384 到 Atlas 960E,三代产品各有核心命题
第一代 · CloudMatrix 384—— 先证明「数量堆叠」这条路走得通。
384 颗芯片分散在 16 个机柜里,怎么连起来?华为的答案是全光互联,用了超过 5000 个光模块。
结果证明这条路确实能跑通,算力也能堆上去。但代价很大——能耗大约是英伟达方案的 4 倍。
先解决有没有的问题,再解决好不好的问题。这是第一代的使命。
第二代 · Atlas 950—— 规模翻到 8192 颗芯片后,可靠性成了最大的挑战。
8000 多颗芯片全连在一起,任何一条链路出问题都可能牵一发而动全身。华为搞了几个关键动作:
自研协议「零渠」统一了芯片、内存、网络的通信协议,实现内存直读,百纳秒级切换故障链路,上层任务几乎无感。
混合网络「近处用铜,远处用光」,90% 以上的连接用铜缆,只有远距离才用光,降低了对光模块可靠性的依赖。
内存策略自研 HBM,针对推理不同阶段(预填充/解码)推出不同内存配置的版本,优化成本与性能。
这一代把「能不能用」变成了「能不能稳定跑大任务」。
第三代 · Atlas 960E—— 直指能耗这个老大难问题。
HiWan 集成光引擎 + 进风装光学,从物理层面降低功耗
降能耗从两头入手:
提升单芯片性能。新一代昇腾 960 算力直接翻倍,达到相同总算力需要的芯片数量减少一半。
集成光引擎(HiWan)。采用「进风装光学」技术,把自研光引擎直接做在主板上,光模块数量从 4.8 万个锐减到 5500 个——
仅此一项,就省下了超过 550kW 的电力。
04
两种路线,殊途同归
回头看,华为和英伟达走的路,其实是在各自约束条件下的最优解。
它们都在回答同一个问题:「我最缺的东西,怎么省着用?」
英伟达路线核心约束:电力资源紧张
技术路线:强芯片 + 省着用
目标:每瓦电、每机柜产出最大算力 华为路线核心约束:先进芯片和 HBM 受限
技术路线:多芯片 + 多用光
目标:用规模弥补单芯片性能差距
一个往「精」走,一个往「大」走。一个追求单位效率极致,一个追求系统规模极致。
没有哪条路绝对更好,它们都是被自己的约束条件逼出来的。
05
我觉得华为昇腾超节点最有意思的地方,不是它堆了多少芯片,而是它证明了一件事——
芯片性能受限的时候,靠系统工程的创新,也能造出有竞争力的 AI 算力平台。
光互联、自研通信协议、集成光引擎、混合网络设计……这些不是为了炫技,都是被逼出来的解法。
这场 AI 算力的竞争,早就不是单颗芯片的比拼了。
是整个系统架构的较量。
热门跟贴