过去几年,行业关注的焦点始终集中在单颗芯片性能、算力指标和制程工艺上,比的是“谁的芯片更快”。然而,随着大模型参数规模持续增长,尤其是MoE(混合专家模型)、Agent(智能体)以及长上下文推理逐渐成为主流,未来算力的竞争,不是单颗芯片峰值性能的比拼,而是将大量计算、存储和网络资源高效组织起来的系统能力之争。如何提升计算系统的有效算力利用率成为主要挑战。
“在传统计算架构下,随着集群规模不断扩大,资源利用率反而可能下降,十万卡集群的实际模型算力利用率仅约20%,大量计算资源并非真正用于模型计算,而是在等待通信完成。”9月17日,在华为全联接大会2026期间,华为常务董事、ICT BG CEO杨超斌说道。另一方面,10T参数大模型训练产生的海量中间数据已经难以由单卡内存承载;进入Agentic AI时代后,Agent与模型每小时交互可达数百次,又进一步增加了CPU、NPU、内存和存储之间的数据交换需求。
这意味着,当AI集群从千卡走向万卡、十万卡甚至百万卡,算力竞争正在从单一计算单元的性能竞争,进一步延伸至整个计算系统的协同效率:不仅要解决“有多少算力”,还要解决计算、内存、存储和网络资源如何高效连接,以及如此庞大的计算资源如何真正作为一个整体运行。
围绕这一问题,杨超斌此次系统阐释了华为面向Agentic AI的新计算架构:华为以灵衢互联为核心,打造集群+超节点的新计算架构,将CPU、NPU、DPU、DDR、SSD等多种计算与存储单元统一互联、分级池化。实现多样性算力高效协同,适应未来业务负载变化,灵活扩展新型异构算力。与此同时,华为还发布了覆盖柜内、跨柜和集群的灵衢互联设备以及基于灵衢的Agentic AI超节点集群及系列化一体机算力底座。
从“增加芯片”到重构计算系统
扩大AI集群最直接的办法,是增加计算卡。不过,当卡数扩展到一千张、一万张乃至十万张之后,新的问题开始出现:每颗芯片都拥有计算能力,却需要不断与其他芯片交换参数和中间数据。如果通信速度跟不上计算速度,越来越多时间就会消耗在数据传输和等待上。
华为副董事长、轮值董事长汪涛给出的一组数据显示,一个由8卡服务器组成的10万卡集群,在模型训练过程中,集群内通信超过训练时间的40%,严重制约了MFU(模型浮点算力利用率)。另据华为马尔可夫实验室的仿真结果,在同样10万卡规模下,由4K规模超节点组成的集群,相比传统8卡服务器组成的集群,MFU提升至原来的2.75倍。汪涛表示,MFU每提升1个百分点,模型迭代时间可以提前约3天。
因此,当集群进入十万卡甚至更大规模后,亟待解决的问题已经不只是如何把更多计算卡“装进”一个集群,而是如何让它们真正高效协同。
这也是华为此次提出新计算架构的出发点。在杨超斌的阐释中,灵衢(UnifiedBus)是这套架构的核心互联技术。与传统服务器中CPU、加速器、内存、存储分别通过不同协议连接不同,灵衢首先做的一件事,是把十余种互联协议统一为一套协议。在灵衢架构下,互联带宽可以从百GB级提升至TB级,RTT通信时延从7微秒压缩至2微秒,支持超节点内全局内存统一编址。
但统一协议和提升带宽解决的只是“数据怎么更快流动”的问题。在传统以单台服务器为资源边界的架构中,CPU、NPU、内存等物理资源通常按整机配置,部署后数量和配比相对固定。即便不同 AI 任务对 CPU、NPU、内存的需求不同,计算资源也很难根据任务负载进行按需重组。
而在灵衢架构下,CPU、NPU、内存、SSD等不同计算、存储和网络设备之间可以直接互联,实现去中心化平等访问,CPU和NPU也能够根据实际计算任务进行更加灵活的资源配比。
这一变化在Agentic AI场景下更加明显。传统大模型更多完成问答和内容生成,而Agent还需要进行任务规划、工具调用和多轮执行。这意味着,一项任务可能在CPU、NPU、内存和存储之间反复流转,对不同计算资源的需求也会不断变化。
针对这一现状,华为提出AF分离部署。Transformer主要由Attention(注意力机制)和FFN(前馈网络)等模块构成,但二者承担的任务和对计算资源的需求并不完全相同。其中,Attention主要负责处理不同Token之间的上下文关联,尤其随着上下文变长,对访存和数据交换的需求会持续增加;FFN则承担大量特征变换和矩阵计算。
过去,Attention和FFN通常在同一套计算资源中连续执行;华为则通过分层分级Transformer硬加速,将二者解耦,分别部署到不同的算力单元,再根据各自的计算特点配置相应资源。这样一来,CPU和NPU不必再按照固定比例跟随服务器部署,而可以根据不同业务、不同计算阶段的实际需求灵活组合,提升推理效率与资源利用率。
如果说AF分离解决的是“不同计算任务如何更灵活地使用算力”,那么随着模型越来越大,灵衢还需要解决另一个更加基础的问题——计算过程中产生的海量数据究竟放在哪里。
大模型参数量和上下文长度不断增加,带来的一个直接问题就是数据“装不下”。尤其在推理阶段,KV Cache会随着上下文长度增加迅速占用内存;10T参数模型训练产生的中间数据,也进一步增加了单卡HBM的容量压力。
对此,华为提出分级存储和全局池化,通过不同介质之间的资源池化扩展整个计算系统能够调用的存储空间。例如,DDR可以成为NPU的“第二内存”。杨超斌介绍称,在搜推广等业务中,这一架构可以降低业务时延,并使千亿级、数千维向量检索性能翻番;在10T大模型训练场景下,则可以降低模型对单卡HBM容量的要求,进一步提升整个集群的模型浮点算力利用率(MFU)。
由此,灵衢承担的角色也逐渐清晰:它并非简单连接更多计算卡,而是试图通过统一互联,将原本相对分散的CPU、NPU、内存、存储和网络重新组织为一个计算系统,提出分级存储和全局池化,通过不同介质之间的资源池化扩展整个计算系统能够调用的存储空间,让整个超节点能够以更接近“一台计算机”的方式运行。
从柜内到集群,灵衢构建三级互联
当一个超节点继续向数千卡、数万卡乃至百万卡扩展时,仅仅解决超节点内部的互联还不够。如何让这套架构跨越机柜甚至数据中心级集群继续扩展呢?
对此,华为进一步将灵衢从超节点内部的互联技术,扩展为一套分层分级的互联系统,分别覆盖柜内、跨柜和集群三级互联,试图解决计算规模不断扩大过程中不同距离、不同层级的数据交换问题,并最终支持从单柜到百万卡集群的弹性扩展。
其中,在单个机柜内部,服务器之间距离较短,但芯片密度越来越高,传统线缆连接也会变得越来越复杂。为此,华为推出柜内灵衢互联刀片,通过光电互联减少大量线缆连接。据华为介绍,柜内灵衢互联刀片可以实现“零电缆、零电路损耗”。以4096超节点为例,可以节省196公里铜缆。
当一个超节点从单柜扩展至多个机柜之后,距离变长、数据量增加,互联既需要更高带宽,也需要控制通信时延。此次发布的跨柜灵衢互联设备支持176个端口,每端口带宽达到1.6T,单机实现280T全光互联,RTT时延最低达到2微秒,可以把分布在不同机柜中的计算资源继续连接为一个更大的计算系统。
而在互联设备之外,华为也开始围绕这套架构构建一个更完整的算力系统。会上,华为发布基于灵衢的Agentic AI超节点集群,由鲲鹏950、昇腾960超节点、OceanStor M900记忆存储以及星河UBG交换机组成,实现多样算力协同与分级资源池化。
值得注意的是,这套架构并非只面向百万卡级超大型AI基础设施。
华为同时将灵衢向更小规模的计算系统延伸,推出从1卡到8卡的系列化一体机以及鲲鹏昇腾模组。其中,Atlas 650E风冷服务器通过双机灵衢直连,可以实现16个NPU免交换互联,两台服务器“像一台运行”,并能够继续平滑扩容形成小型超节点,使中小企业也能够在本地运行万亿参数大模型。
硬件之外,生态仍然是国产算力规模商业化绕不开的另一道门槛。
会上,杨超斌公布,自去年8月华为宣布灵衢开源开放以来,来自企业、高校的众多开发者热情参与、踊跃贡献,社区月活开发者达5200多人,业界累计合入超428万行代码。CANN社区已跃升为中国开源项目活跃度第一的社区。同时,昇腾与DeepSeek Harness、OpenCode、openJiuwen等开源框架协同,打造智能管理、推理加速、安全框架等Agent插件化组件并全量开源;已联合50多家客户、伙伴及高校打造26个行业算子库,并与90多家主流开源社区合作,助力伙伴快速完成行业Agent开发与IT系统对接。
展望未来,他表示:“华为将坚持系统级创新,构筑系列化算力底座,开源开放,联合客户、伙伴和开发者共建生态,为世界提供新选择。”
热门跟贴