智东西作者   陈骏达编辑   漠影
打开网易新闻 查看精彩图片
智东西作者 陈骏达编辑 漠影

AI大模型竞赛,正在进入新的量级。海外,十万亿参数的大模型已经逐步变成现实;国内,数万亿参数的大模型也在加速追赶。为了训出真正的SOTA模型,算力集群从万卡走向10万卡已成为标配。

然而,一个尴尬的现实是:卡越堆越多,真正被利用起来的算力,却没有同步增长。华为的仿真数据显示,在10万卡集群中,卡间通信可能消耗了40%以上的训练时间,算力利用率(MFU)往往不到30%。也就是说,大量昂贵的算力,并没有真正用于计算。

对于训练周期以月计算的前沿大模型而言,MFU每提升几个百分点,都可能意味着数天的训练时间差,以及数千万元甚至上亿元的算力成本变化。

为解决这一挑战,有越来越多的厂商把目光投向一种新的算力组织方式——超节点。与传统集群把计算卡分散在大量服务器中不同,超节点试图通过更紧密的互联、统一的内存空间和更低的通信时延,把数千张卡组织成一个逻辑上的整体。

日前发布的昇腾960超节点,正是这样一套面向10万卡时代的超节点工程化方案。

打开网易新闻 查看精彩图片

一、超节点成必然选择,统一内存编址是关键

从去年开始,“超节点”成为AI算力领域热度快速攀升的概念。华为昇腾910C超节点等方案率先引发行业讨论,此后,国内算力、服务器等厂商也相继推出相关产品。一时间,超节点几乎成了新一代AI算力基础设施的代名词。

在上周的HC2026大会上,华为副董事长、轮值董事长汪涛更是判断,随着大模型迈向10T级参数规模,超节点是AI基础设施建设的必然选择。

打开网易新闻 查看精彩图片

但随着产品不断涌现,一个更基础的问题也随之而来:到底什么才是真正的超节点?如果只是把更多服务器放在一起,再通过高速网络连接起来,那么它与传统AI集群究竟有什么区别?

2026年7月,在世界人工智能大会(WAIC)期间,《超节点定义与实践白皮书》正式发布。这份白皮书由鹏城实验室与全球计算联盟(GCC)联合牵头,38家单位共同参与制定,从行业层面对超节点进行了明确界定。

打开网易新闻 查看精彩图片

白皮书提出,超节点是一种由多个计算节点通过高效互联协议紧密连接,并具备跨物理节点统一内存编址能力的计算系统,逻辑上具有“一台计算机”的特征。

以MoE等主流模型为例,随着参与计算的计算单元数量不断增加,模型中间结果需要在大量单元间频繁交换。集群规模越大,通信和同步带来的开销也越明显。

此时,如果计算单元然只是分散在不同服务器中,通过网络进行数据交换,那么计算卡数量增加,并不意味着有效算力能够等比例提升。

换句话说,超节点真正改变的,并不是简单地把8卡服务器扩展到64卡、1024卡甚至4096卡,而是重新组织计算单元间的连接与协作方式,让分散的计算资源在硬件和软件层面更像“一台机器”

在符合这一架构的系统中,超节点内的算力单元以访问统一的内存共享池,并通过全局地址空间实现跨物理节点访问。相比之下,传统集群中的数据往往需要依赖网络协议,在不同节点之间进行传输。

华为马尔科夫实验室的仿真结果显示,在同样为10万卡的集群中,由4000卡超节点组成的系统,MFU可达到传统8卡服务器集群的2.75倍。

而符合白皮书所定义架构的产品,已经开始进入规模化应用阶段。截至目前,昇腾910C超节点已部署超过1000套,昇腾950超节点也进入规模商用阶段,应用覆盖互联网、运营商、金融、教育、医疗等多个行业。

打开网易新闻 查看精彩图片

从标准定义到产品落地,超节点正在从一个产业概念走向现实。然而,随着超节点规模一路扩大,卡间需要交换的数据量急剧增加,对带宽、时延和可靠性的要求也水涨船高,互联的工程难度开始集中出现

二、把光引擎,搬到算力身边

目前,大规模AI集群内部主要依赖铜缆进行电互联,随着SerDes速率达到224G及以上,传统电互联方案开始面临越来越大的压力。

速率越高,铜缆中的各类损耗就越明显,信号传输距离也越来越受限;而当数千根高速铜缆被集中在一个高密度系统中,布线、散热和维护也会变得更加复杂。

于是,行业开始把目光投向“光”。在此之前,数据中心的光互连长期依赖传统可插拔光模块方案:光模块作为一个独立器件,插在交换设备或计算节点的面板上,信号先沿电路板走线传送到模块接口,再在模块内完成电光转换、进入光纤。

打开网易新闻 查看精彩图片

▲可插拔光模块

可插拔设计的好处在于标准化与可维护,模块坏了可以单独更换,这也是它统治数据中心互联二十余年的原因。但可插拔方案也有一个先天弱点:电信号从计算单元到模块,需要经过一段漫长的电路板路径,随着速率的提升,这段电走线带来的问题变得难以忍受。

NPO(Near-Packaged Optics,近封装光学)试图改变这一过程。它的思路很直接:把光引擎放到计算单元边缘,让电信号尽早转换成光信号。

原本需要通过较长距离电连接传输的信号,在距离计算卡更近的位置完成光电转换,再通过光纤完成更远距离的高速传输。

对于超节点而言,这意味着可以在更高带宽下缩短电连接距离,同时降低互联功耗和时延,并缓解高密度系统中的布线与散热压力。

华为Hi-ONE,就是这一路线的一次工程化尝试。汪涛称,这是业界首个量产的NPO产品,是目前行业最大传输能力的NPO产品,也是唯一实现内置光源的NPO产品。

打开网易新闻 查看精彩图片

Hi-ONE拥有高达7.2Tb/s的带宽,这一带宽来自36个200G Lane的集成。1个Hi-ONE模块,就可以替代9个800G光模块。

对于拥有数千个计算单元的超节点而言,互联器件本身就是系统复杂度的重要组成部分。如果可以把互联器件的数量,布线复杂度、功耗和潜在故障点也会随之减少。

现阶段,NPO技术面临的痛点之一是标准缺位:光引擎贴近计算单元后,封装形式、接口规格、光源方案均无统一约定,各厂商方案互不兼容,产业链难以分工放量,成本居高不下。

在产业标准层面,华为在全球光互联标准组织OIF提出了NPO标准立项的建议,得到了众多行业伙伴的积极响应,其参与推动的《12.8Tb/s光电近封装模块》标准提案已在OIF立项,未来有望形成6.4T/12.8T近封装光学模块的行业标准。

三、昇腾960超节点拆解:4096卡如何像一台计算机工作

如果说超节点定义回答了“什么是一台机器”,NPO解决了“机器内部怎么通信”,那么昇腾960超节点要回答的,就是这两件事能否真正组合成一个大规模计算系统。

昇腾960超节点基于“灵衢+Hi-ONE”打造,采用正交架构和全液冷设计,并通过灵衢实现内存统一编址,将4096颗算力卡在逻辑上融合成一台“超级计算机”。

打开网易新闻 查看精彩图片

具体实现层面,昇腾960超节点使用了约5500个Hi-ONE,替代原本需要的4.8万个800G光模块,模块数量降至约1/9。光模块数量减少,可以使整个系统中的连接器件和潜在故障点同步下降,也降低了互联本身的能耗。

同时,昇腾960超节点的正交架构让计算板与交换板垂直正交、直接互联,这种设计让板间互连路径大幅缩短,损耗更低、信号完整性更好,再叠加全液冷设计,使4096卡这样的高密度部署成为可能。

从规模来看,昇腾960超节点最多可扩展至4096卡,提供8EFLOPS FP8、16EFLOPS FP4算力,以及最高1PB的HBM容量,RTT时延最低可达2微秒。相比上一代昇腾950超节点的1024卡规模,昇腾960将单个超节点的计算卡规模提升至4倍。

大模型训练时,模型权重、梯度、优化器状态及中间激活值均需加载至显存。昇腾960超节点的这些参数,意味着单个超节点能容纳的模型体量直接上了一个台阶,跨节点切分带来的通信开销有望大幅下降。

按照公开数据,昇腾960超节点系统功耗降低超过550千瓦,系统可用度达到99.8%,系统无故障运行时间提升1倍。对于运行十万卡级集群的企业来说,这些指标最终都会转化为自身业务效率的提升。

到这里,超节点Scale Up的问题暂时得到了解答:4096张计算卡,可以被组织成一个逻辑上的整体。但更大规模的AI集群显然不可能只靠一台4096卡超级计算机完成,新的问题又来了。

四、4096卡之后,怎么把“超级计算机”连起来?

有了4096卡超节点,更大规模的集群要解决的是Scale Out问题——也就是节点之间的互联。跨过这一步,10万卡集群才能真正成为现实。

打开网易新闻 查看精彩图片

这正是灵衢UnifiedBus互联架构试图解决的问题。灵衢将十余种互联协议统一到灵衢协议体系中,减少不同协议之间的转换开销,并将互联带宽从百GB级提升至TB级,RTT通信时延从7微秒压缩至2微秒。

基于灵衢,多个昇腾960超节点可以通过灵衢网络或RoCE连接在一起,进一步构建超节点集群。通过二层CLOS四平面组网,灵衢支持的最大集群规模可达到51.2万卡;再结合多轨道拓扑技术,最大可支持100万卡昇腾超节点集群。

但超节点集群的挑战不止于“连得更多”。更大规模的AI算力集群,不是某一种算力单元的独角戏,NPU之外,CPU、内存、存储同样重要。而传统体系里,这些资源各自采用不同的互联协议,规模越大,协议转换与跨节点通信的开销就越突出。

正因如此,灵衢试图进一步打破不同计算资源之间的边界:在这一体系下,昇腾超节点、鲲鹏超节点、KV缓存集群等不同子系统平等互联,CPU、NPU、内存和存储不再是彼此独立的资源,而是通过统一协议进行通信和协同。

这一需求,在AI进入Agent时代后变得更加迫切。一个Agent在运行中,可能同时需要调用模型、启动沙箱、访问数据库、进行向量检索,在CPU、NPU、内存和存储之间不断交换数据。

因此,通算与智算的融合,成为超节点向更大规模基础设施演进的另一个方向。全新升级的鲲鹏超节点基于灵衢全光组网,最大支持4096节点,形成256TB统一内存池;在Agent场景中,十万级别沙箱启动相比传统服务器方案提升30倍,百亿千维复杂向量检索效率实现倍增。

打开网易新闻 查看精彩图片

从4096卡的单个超节点,到51.2万卡乃至100万卡的集群,算力基础设施的边界不断外扩,而贯穿始终的,是同一套互联体系。

结语:10万卡之后,AI基础设施进入“系统工程”时代

回到文章开头的问题:为什么 10 万张卡,没有 10 万张卡的算力?

因为当计算规模不断扩大,真正限制有效算力的,已经不只是计算卡本身。数据移动、结果同步、通信、系统散热、故障恢复,集群运转的每一个环节都在影响计算,而其中任何一个环节掉队,都会拖累整台“机器”的效率。

在HC2026大会上,汪涛反复强调,如今的AI基础设施竞争已进展到复杂的、多学科的系统工程阶段。在这场较量中,华为“计算+通信”的综合优势得到集中体现:从NPU到超节点,从光引擎到统一互联协议,每一层都指向同一个目标,让算力真正被用起来。