华为全连接大会上,徐直军披露了一组让全场安静的数字:昇腾在中国AI芯片市场的份额达到50%,英伟达降到8%。四年前这两个数字是反过来的,英伟达95%,昇腾3%。

这组数字出自机构测算,不同口径的统计差异不小,但50%对8%的格局本身已经不需要争了。值得琢磨的不是"昇腾怎么做到的",而是50%和8%到底在衡量什么。

它衡量的是芯片的颗数,不是有效算力。 一颗芯片摆进采购清单就是一颗,不管封装等级、算力规格、片上带宽,数过去就是一颗。训练大模型吃的是有效吞吐:同一颗芯片放在不同架构里,真正能兑现的浮点算力利用率差距可以是好几倍。采购名单上写的是颗数,集群里跑的是有效算力。

但我想说的是:昇腾这四年做的事,是把竞争的基本单位从一颗芯片换成了一整套系统。单颗算力暂时追不上,就把一百万颗芯片变成一台计算机。

打开网易新闻 查看精彩图片

受国内先进制程节点限制,单看一颗芯片的性能,昇腾和英伟达仍有差距。徐直军自己也坦陈了这一点。但华为没在这条道上硬刚,不跟你比单芯,跟你比整个集群怎么协同。这套打法的底层叫Peerium计算架构,核心是两条:嵌套并行打破图灵范式的串行,统一内存寻址加对等互联,突破冯·诺依曼的主从架构。换句话说就是让百万级处理器不再是一堆互相等数据的孤岛,而是像一台计算机那样协同工作。

支撑这套架构的关键技术叫灵衢(UnifiedBus),解决一个老问题:传统数据中心里PCIe、NVLink、以太网十几种协议并存,跨节点流量要在协议之间来回转换,每次转换都卡微秒级的等待,集群规模一铺开,计算单元大量时间在空等数据。灵衢做的事就是把十几种协议统一成一套,计算、存储、网络全在一条总线上平等互联,协议转换的中间开销从微秒级压到纳秒级,柜间通信带宽做到800GB/s。带宽翻倍不稀奇,难的是协议统一。CPU、NPU、内存、SSD、网卡、交换机的底层设计得同时改,不是单买几块交换芯片就能搭出来的。

光协议统一还不够,电互联的物理瓶颈在那摆着。高速信号走铜线,距离稍长就衰减、发热、占地方。华为的解法叫Hi-ONE,业界首个量产的近封装光学NPO引擎。单引擎传输7.2T,36条光通道每条跑200G,最难啃的是内置光源:业界多数方案走外置光源,一个光源馈送32路信号,功率得放大32倍,耦合接口容易出问题。徐直军判断,未来两三年内很难有其他厂商做出内置光源方案。主芯片到光引擎的距离只有约5厘米,就剩这一小段用铜线,其余全部走光。

数据算一下。昇腾960超节点用约5500个Hi-ONE,替代了原本需要的4.8万颗800G光模块。一个Hi-ONE顶9颗光模块,省掉的是4万多颗模块的采购成本、插损和功耗。系统功耗直接降了550多千瓦,相当于少了一个中型数据中心一年几百万元的电费。无故障运行时间提升一倍,可用度到99.8%。这不是省几块钱的事,是整个节点的供电和散热设计都跟着简化了。

协议统一了,光互联拉近了,最终落在一个可量化的结果上:10万卡集群的模型浮点算力利用率(MFU),从行业普遍的20%跃升到35%。别小看这15个百分点,它把同等硬件规模下的有效训练吞吐多拉了七成多。传统架构下10万张卡里有8万张在等数据传输,通信占了训练时间四成以上,集群越大通信开销越重,MFU越往下掉。灵衢统一了协议、Hi-ONE把光互联拉近了,跨柜往返时延压到约2微秒,4096卡超节点还能省掉196公里铜缆。在万亿参数模型上,这15个百分点意味着训练周期按周计地压缩。汪涛在会上说,MFU每提升1个百分点,模型迭代时间就能提前约3天。15个百分点,就是一个半月。

打开网易新闻 查看精彩图片

这些指标不是理论值,已经在商用产品上跑出来了。昇腾910C超节点已部署超过1000套,联合3000多家伙伴孵化了7000多个行业方案,覆盖互联网、运营商、金融、教育、医疗、交通、制造20多个行业。新一代昇腾950超节点(Atlas 950 SuperPoD)已经规模商用。昇腾960超节点单节点支持4096卡、8EFLOPS FP8、1PB HBM统一内存,风冷版计划2027年二季度上市、液冷版三季度上市。一个25.6万张卡的超级集群正在部署测试,对应的是未来两年中国6到7家前沿实验室训练10万亿到40万亿参数基础模型的需求,这个规模也受制于数据中心电网承载力。

能把芯片、总线、光引擎、液冷、软件同时改到位,门槛不在某个零件,在跨环节协同。华为把昇腾超节点、鲲鹏超节点和KV Cache子系统放到同一套灵衢协议下对等互联,热、温、冷数据分层访问,KV Cache一跳直达。系统能力是在这种协同里长出来的。单个部门搞不定,得芯片、网络、存储、散热几个团队一起改。

软件这一层的进度比硬件更难量化。两年前昇腾最大的坎是PyTorch和CUDA筑起的软件壁垒。海思首席科学家廖恒在同场演讲里说,近18个月随着模型数学复杂度提升、新编译器语言不断涌现,前沿实验室对CUDA的依赖已经明显下降,软件差距在快速收敛。CANN开源后进了PyTorch官方支持列表,和英伟达、AMD、英特尔并列,社区月活开发者超过5200人,外部开发者占比61%首次超过内部,已建成26个行业算子库。2026年7月,华为联合百度、京东云、中国移动和电子标准院发布OPEN NPO国内统一MSA多源协议,把接口标准从一家企业的方案推到行业协同,还在全球光互联标准组织OIF提了NPO标准立项。标准这件事的价值不在于谁先想到,在于谁把它写进规范里。

份额过半是个阶段性读数,不代表替代已经走完。徐直军说了一句大实话:目前制约昇腾进一步放量的主要问题不是市场需求,是供货能力。他判断全球AI算力供需平衡大概在2029年实现,中国可能稍晚。960液冷版2027年三季度才上市,25.6万卡集群的部署结果还在测,这几个时间点能不能赶上,决定了替代是持续的还是阶段性的。

读一家公司发布会的价值,不在它宣布了什么,在它给出的时间表能不能被后续事实验证。但有一件事现在就可以下判断:当算力竞争的单位从一颗芯片换成一套系统,英伟达那套"卖最先进单卡+收CUDA税"的游戏规则,就已经被从根上改写了。

打开网易新闻 查看精彩图片