打开网易新闻 查看精彩图片

华为昇腾中国份额超英伟达:AI算力竞争进入“体系化”新阶段

2026年9月17日,华为全连接大会期间,华为轮值董事长徐直军与海思首席科学家廖恒博士面对媒体,披露了一组关键信息:华为昇腾AI芯片在中国市场的份额已超越英伟达。同时,华为发布了面向AI时代的全新计算架构Peerium、互联技术UnifiedBus(灵衢总线)以及基于这些技术打造的Atlas 950 SuperPoD,并透露一个拥有25.6万张计算卡的SuperCluster正在部署和测试中。

这一消息的行业分量,远非一个市场份额数字可以概括。它意味着中国AI算力底座在经历了数年的“单点追赶”后,开始进入“体系化构建”的新阶段——从芯片、总线、集群到软件生态,中国科技企业第一次拥有了可以与美国AI算力体系进行全面对标的自主路径。

一、份额超越背后:从“有没有”到“用不用”的转折

徐直军在回答媒体提问时明确表示,根据华为收集的数据,昇腾已经超越英伟达成为中国市场第一大AI芯片供应商。尽管他同时强调英伟达的市场份额数据“很难收集”,但这一表态仍然具有标志性意义。

更能说明问题的是需求的转向。徐直军谈到,昇腾950PR推理芯片已推向市场,而基于昇腾950DT的SuperPoD训练集群正在测试中,大规模供应将在今年年底或明年年初开始。他直言:“不在于我们要多努力去推动模型提供商,而在于我们有多少供应能力。”这句话背后是一个重要的产业现实:中国头部AI实验室对国产算力的态度,已从“被动的备选方案”转向“主动的产能争夺”。

在回答中国推动芯片自给自足的问题时,徐直军的表述相当笃定:“中国人有强烈的紧迫感,不会接受由别人决定我们能否获得某些产品的未来。即使我们的芯片可能不那么先进,至少供应是有保障的。”这句话点出了昇腾份额超越英伟达的根本逻辑:在地缘政治持续施压的背景下,中国AI产业对“算力供应链安全”的诉求已经从技术选项上升为战略刚需。

二、Peerium架构:AI时代的“新计算机”

昇腾份额超越英伟达,只是结果;真正的技术变量,是华为在计算范式层面所下的赌注。

去年全连接大会,徐直军发布了昇腾芯片路线图和UnifiedBus开放协议。今年,华为将整套技术体系升维为Peerium计算架构。这一架构的要害,不是某一颗芯片的单点性能,而是“让一百万个处理器像一台计算机一样工作”。

传统计算体系建立在冯·诺依曼单机架构和主从模式之上,CPU指挥,其他部件执行。这种模式在单机时代效率不低,但一旦进入“万卡、十万卡、百万卡”集群规模,主从架构的通信开销和同步瓶颈就会急剧放大。英伟达用NVLink解决机架内通信,用InfiniBand解决机架间通信,但两种协议之间的转换延迟以微秒计。

华为的选择是另起炉灶:用嵌套BSP(批量同步并行)扩展图灵并行范式,用统一内存寻址和对等互连替代主从模式,再以UnifiedBus一种协议贯穿机架内、机架间、数据中心间乃至自治区域间的所有通信层级。廖恒对此有一个形象的比喻:“想象一下,如果你的旅程涉及飞机、高铁和汽车,中转相当耗时。有了UnifiedBus,从纵向扩展网络移动到横向扩展网络,可能只需要150纳秒,协议转换开销至少节省了一个数量级。”

值得关注的是,UnifiedBus协议自去年开放以来,下载量最大的地区竟是硅谷。这一细节说明,华为在AI互联技术上的方向判断,已经引起全球最前沿工程师的注意——尽管华为可能并不希望在硅谷获得那么多关注。

三、25.6万卡SuperCluster:正在部署中的“算力巨兽”

在本次大会上,外界最关心的技术参数之一,是华为训练集群的规模化上限。

廖恒在回应中透露,25.6万卡(约20万)规模并非随意选择的数字。这一规模与未来两年中国6到7家前沿AI实验室训练10万亿到40万亿参数基础模型的内存需求相匹配;同时,考虑到单个数据中心园区的电力输送系统设计,20万卡也是一个较为务实的持续训练规模。

不过,需要特别厘清的是:华为目前正在推进的并非已完成部署的25.6万卡集群,而是“正在部署和测试中”的SuperCluster。在产业界极易出现“发布即量产”误读的当下,这一表述的准确性尤为重要。从历史节奏看,华为去年发布的SuperPoD解决方案已出货超1000套(搭载384个910C处理器),而基于昇腾950DT的SuperPoD训练集群,其规模化供应要待今年年底或明年年初才能启动。

即便如此,25.6万卡的测试规模本身已是全球AI算力竞赛中极具分量的一个坐标。要知道,业界最高水平的集群建设也正处于从“万卡”向“十万卡”跃迁的关键时期,多路线并行、多方案并存是当前格局。华为以“正在部署测试”的SuperCluster回应外界对其超大规模集群能力的关注,既是对工程节奏的如实描述,也点明了这一方向的现实挑战——从部署到稳定运行,还有相当长的路要走。

四、NPO的务实主义:华为为何没选CPO

在光互连路线的选择上,华为的取舍也折射出其工程哲学的独特性。

当前业界在解决“光进铜退”的问题上存在两条技术路径:CPO(共封装光学)将光引擎与交换芯片封装在一起,互连距离短但成本高、可维护性差;NPO(近封装光学)则保留了约5厘米的铜互连,将光引擎置于芯片附近,在成本、良率和可维护性之间取得平衡。

徐直军明确表示,华为内部几乎未就这一选择展开辩论,“华为从事光器件、光模块和昇腾芯片,所以我们知道哪个是我们的最佳选择。”这并非对CPO的全盘否定,而是基于工程实施、成本、供应链和可维护性的综合判断——NPO比CPO的成本低近40%,且光引擎出现问题时,AI芯片不会随之报废。

华为此次发布的Hi-ONE模块,即是一个NPO模块,支持7.2T带宽,距离主芯片仅5厘米,光源集成于模块内部。徐直军判断,未来两到三年内,其他厂商难以生产出同级别的模块,这得益于华为在光子学领域多年的积累。

更具风向标意味的是业界的集体转向:在国际光互联论坛(OIF)最近的讨论中,早前坚决支持CPO的部分成员已改变立场,启动了新的NPO项目。据徐直军透露,OIF约40家厂商在看到NPO带来的实际收益后,现在均对这一路线表达了支持。中国光模块产业本就占据全球半壁江山,华为在NPO路线上的坚定推进,也意味着中国AI算力底座在光互连这一关键环节上握有了更多自主定义权。

五、CUDA护城河正在被“新编程范式”填平

谈及昇腾与英伟达的最大差距,业界通常首先想到软件生态。廖恒坦承,昇腾遇到的第一大障碍并非硬件本身,而是软件生态——CUDA的长期主导地位使整个学术界和工业界习惯于“PyTorch加CUDA”的开发模式。

但廖恒同时指出,过去18个月发生了一个关键变化:前沿大模型的编程方式正在从“粗粒度PyTorch脚本”转向“大内核风格编程”,模型计算变得越来越细粒度,单纯依靠PyTorch已无法保持效率,开发者必须转向新的编译器语言和编程范式。

这一转变对后来者而言恰恰是“机会窗口”:当整个行业的技术底座发生位移时,CUDA的多年积累并不自动转化为新范式下的优势。廖恒认为,在软件生态层面,昇腾与CUDA的差距已经“大大缩小了”,甚至正在接近平衡。

当然,这种乐观的表述也需要审慎看待。CUDA生态沉淀了全球数百万开发者、数十年的算法库和工具链,短期内“抹平差距”并不可信。但华为的策略的确切中了要害:与其在CUDA的延长线上竞争,不如在AI计算范式切换的窗口期,用统一架构和开放协议重新定义竞争维度。廖恒所言的“CUDA不再被前沿实验室视为重要,远不如两年前那么重要”,虽有立场使然,但也确实指出了行业正在发生的变化。

六、供应链瓶颈与全球化取舍

对于产能瓶颈,徐直军的回应保持了清醒:“中国大陆的瓶颈基本上与世界各地的瓶颈相同。全球产业没有为我们所看到的AI激增做好准备。”光模块、存储产品的供应商之所以敢报出极高溢价,并非产品有多好,而是供应短缺。

他给出的全球供需平衡时间点是2029年左右,中国大陆可能更晚。而在此之前,华为的策略非常明确:优先供应对算力有迫切需求的中国客户;在中国以外的市场,只向“无法获得替代解决方案或者想要一个替代方案”的有限客户供应。近期有报道称马来西亚正在考虑将昇腾910C加速器作为其主权AI计划的核心,这恰是这一策略的落地案例。

值得注意的是,徐直军在回应中特别将华为的AI战略与其通信产业历史做了承接:“关注通信行业的记者朋友们可能知道华为过去几十年走过的历程。AI也是一样。”2007年至2025年间,华为累计研发投入超过1.8万亿元人民币,其中10%用于基础研究。这样的投入强度,是华为能够同时推进芯片、计算架构、总线协议、光互连、软件栈等多线创新的底层支撑。

在徐直军看来,UnifiedBus不仅是一张“总线”,更是AI计算未来的基座:“只有借助UnifiedBus互连技术,你才有可能构建一台拥有百万处理器的巨型计算机。”他预判,未来几年其他参与者肯定会跟进,这也是华为选择将UnifiedBus协议开放的原因——“我们期待全行业共同努力,迈向通用人工智能。”

结语:超越之后,真正的考验刚刚开始

昇腾在中国市场超越英伟达,无疑是一个值得标记的时刻。它意味着中国AI产业第一次在算力底座的“自主选择权”上获得了实质性突破。但超越英伟达的市场份额,不等于超越英伟达的技术体系。在软件生态的深度、开发者社区的广度、行业应用的工具链完备度上,昇腾仍有明显差距。

华为给出的解题思路不是“在英伟达的路线上跑得更快”,而是“换一条路,带上整个产业链一起跑”。从Peerium计算架构到UnifiedBus统一总线,从NPO光互连路线到开放协议构建生态,华为正在将过去三十年在通信领域积累的“系统能力”迁移到AI算力领域。

这场竞争的终局,也许正如徐直军所言,取决于整个中国产业链的供需平衡何时达成。但可以确定的是,AI算力的竞争已经不再是某颗芯片的独角戏,而是计算架构、互联技术、光电子、软件生态与制造供应链共同构成的“体系化”较量。在这个体系中,中国通信产业过去几十年锻造的工程能力,正在成为AI时代最坚实的底座之一。