打开网易新闻 查看精彩图片

导语

当大模型对算力的渴求逼近物理极限,单纯堆叠芯片的路径正遭遇互联带宽、内存寻址和调度效率的重重壁垒。华为近日发布全新计算架构——Peerium,提出“百万级处理器成为一台计算机”的系统性解法。该架构通过嵌套并行、统一内存寻址与平等互联,打破了传统图灵计算范式下的主从关系,并首发Atlas 950超节点产品,25.6万卡集群已在部署中。这不仅是华为AI算力体系的迭代,更可能重新定义AI基础设施的竞争规则。

事件背景:AI算力扩展遭遇“三重墙”

过去十年,AI算力的增长主要依赖芯片制程与单点性能提升。但随着摩尔定律放缓,训练万亿参数模型所需的算力,已无法靠单一处理器满足。行业普遍转向“集群式”堆叠——用高速网络连接成千上万块加速卡。然而,这一路径正遭遇三重瓶颈:

一是通信墙。集群规模扩大后,卡间通信时延和带宽成为主要矛盾,许多算力在等待数据中流逝。传统以太网或专用互联方案在扩展到十万卡量级时,同步效率急剧下降。

二是内存墙。分布式训练中,数据需要反复在处理器和远端内存之间搬运,统一内存寻址的缺乏导致数据局部性差,资源利用率低。

三是架构墙。现有AI计算集群大多沿用“主从架构”——由控制节点下发指令、计算节点执行任务。这种层级关系在万卡阶段尚可支撑,一旦迈向十万甚至百万级处理器,主从之间的调度开销和故障恢复复杂度将不可控。

华为此次发布的Peerium计算架构,正是针对上述结构性难题提出的系统性方案。其核心逻辑不是做更快的芯片,而是重新设计“这么多芯片如何协同”。基于嵌套并行模型Nested BSP,Peerium将庞大集群视为一台拥有统一内存空间的“巨型计算机”,而非若干独立节点的简单拼接。同时,通过打破主从边界,实现计算、存储、网络的平等互联,让任意处理器都能直接访问全局资源,从而大幅降低协同开销。

关键在于“灵衢”互联技术。它基于开放协议,可无限扩展地连接CPU、NPU、内存、SSD、网卡和交换机,本质上是将传统分立的总线、存储网络和计算网络统一为一张高速总线。由此,百万级处理器不再是“一群机器连在一起”,而是一个单一的计算实体。

行业影响:从“芯片竞争”转向“架构竞争”

Peerium架构的发布,其产业意义远超一款产品,它标志着AI基础设施的竞争焦点正在发生转移:过去拼的是单卡算力有多强,现在拼的是集群协同效率有多高;过去看的是GPU规格参数,现在看的是互联架构能否支撑百万卡规模。

对华为自身而言,这一架构将其在通信领域的积累转化为计算领域的差异化能力。灵衢互联本质上是“用做网络的方式做计算”,将长期形成的高速互联、光通信、数据中心网络技术融入AI计算体系,实现从芯片、网络到系统级架构的全栈贯通。这使得华为不再只是提供AI处理器或加速卡,而是提供一套面向未来的AI算力基础设施标准。

对全球AI产业而言,Peerium架构提出了不同于英伟达主导的“GPU+高速网络”的技术路线。英伟达以NVLink和InfiniBand构建生态,强调单卡性能和GPU间互联;华为则从系统拓扑层面重新定义处理器关系,强调“平等互联”和“统一寻址”。两种路线将推动AI基础设施走向多元化,避免单一技术垄断带来的产业风险。

对产业链上下游而言,开放协议是关键信号。灵衢的协议开放意味着交换机、光模块、服务器、存储等环节的厂商有机会围绕新架构构建生态,而非被封闭生态绑定。特别是对国内通信设备、光通信、算力网络企业,这可能带来新的增量市场——从超节点内部的高速总线到集群间互联,都需要配套的硬件和解决方案。

从产业竞争格局看,Peerium架构的落地正在提速。据华为透露,首发产品Atlas 950超节点集群已经在部署中,规模达到25.6万卡;同时,基于NPO(近封装光学)的Atlas 960系统正在测试中。这意味着该架构并非停留在概念阶段,而是已进入工程交付和迭代周期。对于正在建设智算中心的运营商和行业用户而言,这种“架构+产品+系统”的交付模式,有望降低超大规模集群的建设与运维门槛。

趋势展望:算力体系正在走向“单机化”

“百万处理器成为一台计算机”的愿景,揭示了AI算力发展的一个重要方向:规模化的尽头是“重新发明计算机”。当处理器数量足够多、互联足够紧密、寻址足够统一,分布式计算的外壳会逐渐融化,最终呈现给用户的仍是一台“超级计算机”的简洁抽象。

这一趋势将深刻影响未来五到十年的AI基础设施建设。一方面,超节点和集群的边界会越来越模糊。过去,一个机柜、一个数据中心是物理边界;未来,通过高速总线与开放协议,跨数据中心、跨区域的算力资源可以被组织成逻辑上的一个整体。正如徐直军所言,华为希望让算力无处不在、让智能无所不及。Peerium架构正是实现这一目标的底层支撑。

另一方面,光互连和先进封装技术将发挥更加关键的作用。Atlas 960采用NPO方案,表明面向百万级处理器协同,电互连的功耗和密度已难以满足需求,光互连正从机房级走向板卡级、芯片级。这对光通信产业是一个巨大的拉动——更高速率的光模块、硅光芯片、共封装光学等技术的应用窗口有望提前。

当然,架构创新只是第一步。新架构需要编译器、通信库、调度框架等全栈软件的适配,更需要一个开放的生态来吸引开发者。华为在此前的全联接大会上曾披露,昇腾+CANN原生训练模型超过40个,openEuler装机量突破2000万套。这些基础软件和开源社区积累,将为Peerium架构的推广提供支撑。

从更宏观的视角看,中国AI算力产业正经历从“跟随式拼装”到“定义式创新”的转变。Peerium计算架构的出现,让中国企业在AI基础设施的关键层面拥有了原始创新的发言权。未来,围绕这一架构的软硬件生态能否快速成熟,将决定它在全球产业格局中的实际分量。但无论如何,AI算力的下一场竞逐,已经不只是芯片之战,更是体系之争。谁能让百万颗处理器像一颗核心一样高效运转,谁就可能掌握智能时代的算力基座。