9月17日,华为全联接大会2026在上海开幕。华为副董事长、轮值董事长汪涛在主题演讲中披露,昇腾960芯片研发进度超预期,昇腾960超节点正式发布,业界首个采用NPO光互联的超节点亮相。同期,华为发布Peerium计算架构,提出让百万级处理器协同工作如同一台计算机。大会之外,DeepSeek被曝计划部署16万颗华为AI加速器,马来西亚考虑采用华为方案建设主权AI。芯片、超节点、光互联、计算架构、生态订单与国际竞争多条线索交汇,国产算力正在从单点突破转向全栈体系化竞争。
一、芯片与超节点:提前量背后的系统打法
汪涛对AI基础设施给出了一组判断:到2030年,大模型参数规模可能达到100万亿以上,触及人脑神经元突触数量级;智能体将从按小时工作走向以月为单位执行任务;中国每日推理Token已约500万亿,2030年可能达到百万万亿级;端侧手机模型从2024年的3B发展到今天的30B,未来将进一步走向100B级。这些变化对AI基础设施的规模、性能和可靠性提出更高要求。
华为AI战略的核心仍是算力,坚持硬件变现,围绕“超节点+集群”,通过系统架构创新构建竞争力,打造中国坚实算力底座,为世界构建新的选择。本次大会上,昇腾芯片路线图进一步清晰:昇腾960DT支持2 PFLOPS FP8、4 PFLOPS FP4算力,片上HBM容量最大可达288GB,访存带宽可达9.6TB/s,将于2027年第一季度准备就绪,比原定目标提前三个季度;昇腾960PR支持2 PFLOPS FP8、8 PFLOPS FP4算力,将于2027年第三季度就绪,较原计划提前一个季度。未来,昇腾系列将坚持一年一代,2028年和2029年分别推出昇腾970与昇腾980,依托τ定律创新方向,实现算力规格继续翻倍,访存带宽、访存容量、互联带宽等也将大幅提升。
昇腾960超节点是本次发布的核心产品。该超节点基于灵衢(UnifiedBus)总线与全新NPO光互联产品Hi-ONE打造,单节点达4096卡,提供8 EFLOPS FP8、16 EFLOPS FP4算力与1PB HBM容量,系统可用度99.8%,风冷、液冷版本将于2027年第二、第三季度陆续上市。华为披露,昇腾超节点已部署超过1000套,客户超过370家,昇腾950超节点也已规模商用。仿真显示,以超节点构建的10万卡集群,模型浮点算力利用率(MFU)较普通服务器集群提升2.75倍。华为据此判断,超节点是建设超大规模AI基础设施的必然选择。
有分析人士注意到,此次公布的昇腾960超节点为4096卡规模,而早前路线图中曾出现更大规模SuperPoD规划,芯片提前与系统规模之间的匹配节奏仍需观察。但可以确定的是,华为的竞争焦点已不仅是单芯片,而是用互联、内存编址、散热和运维把芯片组织成一台更大计算机。
二、NPO走向前台:光互联成为算力集群的“规模变量”
继英伟达以硅光交换机推动CPO商业化之后,华为选择了一条不同的光互联路线——NPO。NPO全称近封装光学,技术定位介于传统可插拔光模块与CPO共封装光学之间。CPO将光学器件与交换芯片封装在同一基板内,集成度最高、性能最优,但光引擎故障后通常无法单独更换。NPO将光学器件独立封装并部署在芯片附近,在缩短高速电信号路径、降低功耗的同时,保留光引擎可插拔、可独立维护的特性,在制造良率和运维成本之间取得平衡。对于要部署万卡级集群、且必须保证可用性的超大规模智算中心而言,这一取舍具有现实意义。
华为本次发布的Hi-ONE是NPO路线的关键产品。据介绍,Hi-ONE通过光、机、电、磁、热等要素均衡设计,实现单引擎7.2T传输容量,内置36个通道,单通道速率可达200Gbps,是业界首个量产的NPO产品,也是目前传输能力最大的NPO产品,并且是唯一实现内置光源的NPO产品。昇腾960超节点用5500个Hi-ONE,替代原本需要的4万8千颗800G光模块,降低超过550千瓦功耗,系统无故障运行时间提升一倍,系统可用度达到99.8%。其RTT时延最低可达2微秒,面向十万亿规模大模型的训练与推理。
NPO并非临时起意。2026年7月,华为联合中国移动研究院、百度、京东云等二十余家产业链单位发起OPEN NPO项目,推出国内首个NPO光互连MSA,目标是建立开放统一的NPO技术规范,打通接口、机械、电气与测试标准,支撑万卡级超节点算力集群落地。按规划,首版技术规范计划2026年三季度发布,2027年推进规模化商用。在此前于深圳举办的中国国际光电博览会上,华为已展出7.2Tbps NPO光引擎产品,并联合多家厂商完成NPO交换机跨厂商互通演示。技术细节上,华为NPO方案将DSP功能集成进交换机ASIC内部,移除光引擎内的独立DSP器件,链路时延从100纳秒压到10纳秒,互连功耗降低约60%。对光通信产业链而言,这些指标构成了一份可以直接对标的工程清单:光互联的带宽、时延、功耗与可维护性,正在成为决定算力集群能建多大、能跑多久的关键变量。
三、Peerium与灵衢:百万处理器协同的底层逻辑
华为同期发布AI时代全新计算架构Peerium。该架构基于嵌套并行、统一内存寻址和平等互联,实现百万级处理器的强扩展能力,突破冯·诺依曼单机架构的限制。同时,Peerium提出Nested BSP,将并行计算任务分层递归组织,试图突破传统图灵范式的约束。华为表示,这一架构颠覆了长久以来的主从架构,让百万级处理器作为一台计算机协同工作。
灵衢是实现Peerium架构的关键互联技术。其基于一个开放协议,可无限扩展地联接CPU、NPU、内存、SSD、网卡和交换机,实现计算、存储与网络的平等互联。Atlas 950超节点是Peerium计算架构的首代产品,25.6万卡Atlas 950超节点集群已在部署中,基于NPO的Atlas 960系统正在测试中。华为轮值董事长徐直军表示,AI时代,华为基于开创的Peerium计算架构,持续打造满足客户训练和推理需求的超节点和集群,让算力无处不在,让智能无所不及。
围绕超节点集群,华为还推出鲲鹏超节点和AI记忆存储OceanStor M900。鲲鹏超节点基于灵衢全光组网,最大支持4096节点,形成256TB统一内存池。在Agent沙箱场景,十万级别沙箱启动相比传统服务器方案提升30倍,沙箱密度还可再提升25%;在百亿千维复杂向量检索场景下,检索效率较传统服务器实现倍增。OceanStor M900则是L3.5层PB级KV缓存集群,基于灵衢UnifiedBus支持“一跳直连”,采用混合介质加优化Retention算法,可将SSD读写寿命提升16倍。华为将昇腾超节点、鲲鹏超节点、KV缓存集群通过统一灵衢协议互联,大幅减少协议转换开销。这一架构的目标很明确:让大规模异构算力在逻辑上像一台计算机一样工作。
四、生态与订单:从“可用”到“被选择”
生态进展是本次大会的另一条主线。鲲鹏全球开发者已超过416万,生态合作伙伴超过7200家,累计支持560多个全球开源项目;openEuler装机量突破2000万套,稳居中国服务器操作系统份额第一。昇腾CANN进入常态化开源社区运作,外部开发者首次超越内部开发者,占比达到61%,社区月活开发者突破5270名,成为中国最活跃的开源社区之一。基于昇腾+CANN的原生训练模型已超过40个,是国内唯一支持预训练的技术路线;昇腾已覆盖PyTorch、Triton、vLLM、veRL等90多个主流三方社区。在Linux基金会支持下,昇腾正式成为PyTorch官网可直接安装的算力平台,也是首个来自中国的算力平台。这些指标显示,昇腾生态正从“可用”向“易用”迁移。
订单侧信号同样强烈。据Bloomberg等外媒报道,DeepSeek计划在内蒙古新数据中心部署至少16万颗华为AI加速器,可能成为已知最大的中国AI芯片集群之一,使用下一代昇腾950DT运行模型。但交付周期可能超过一年,华为目前产能不足以满足DeepSeek的计划订单,高端内存等组件短缺预计将限制950DT今年产量至数十万颗,且华为还需平衡其他客户需求。DeepSeek已请求北京帮助协调华为加快分配。报道还称,DeepSeek目前不打算用950DT训练模型,训练仍依赖英伟达加速器。内蒙古项目规划为千兆瓦级,耗电量约相当于75万户家庭。另一则消息是,马来西亚正考虑采用华为技术建设主权AI,项目规模约20亿林吉特(约4.94亿美元),评估产品为昇腾910C。若落地,这可能是首个外国政府选择中国AI技术而非美国方案的案例。
五、国际竞争与AI节奏:自给、加速与风险平衡
华为轮值董事长徐直军在大会期间表示,中国AI模型提供商可能尚未具备足够算力和模型能力,去感知美国前沿开发者所报告的风险;中国AI发展可能需要加速到能够“感受风险”的水平,同时要在推动AI发展与风险管理之间取得平衡。华为还预测,到2035年,自主智能体将贡献全球AI流量的90%以上,Token消费量较当前增长10万倍;徐直军补充称,六到七个中国AI实验室可能在未来两年内瞄准10万亿至40万亿参数模型。
他承认华为在半导体领域不如美国领先者,但美国出口限制反而促使中国客户采用国产技术,华为正推动芯片及整个半导体供应链实现完全自给自足。外部环境方面,美国对先进AI芯片和半导体技术的出口管制持续,英伟达高端芯片在中国市场受限,国内替代需求上升。中国外交部呼吁以开放方式推进AI,国家媒体则批评美国相关提案带有冷战思维。外媒TechCrunch在报道中特别提到,华为将昇腾960DT发布提前至2027年一季度,距美中领导人9月24日华盛顿会面仅一周。
趋势展望:算力竞争进入“系统级”阶段
从本次大会释放的信息看,国产算力的竞争维度已经扩展为芯片、互联、光通信、存储、操作系统、框架、标准、订单和国际规则的复合竞争。超节点+集群成为超大规模AI基础设施的必然选择,光互联的带宽、时延、功耗和可维护性决定集群规模上限。NPO与CPO的路线分化,反映出华为在性能与运维之间的工程取舍;灵衢和Peerium则试图把百万级处理器统一为一台计算机。生态方面,CANN、openEuler、PyTorch安装支持等进展,正在降低开发者迁移成本。订单方面,DeepSeek的16万颗昇腾950DT计划和马来西亚主权AI选择,表明国产算力已进入被头部模型公司和海外政府评估的阶段,但产能、高端内存、训练生态仍是现实约束。
未来一年,昇腾960DT/PR、Atlas 860/960超节点、NPO MSA、DeepSeek部署进展和马来西亚决策,将成为观察国产算力全栈能力的关键窗口。华为重申打造硅基黑土地、坚持开源开放,“众智之所为,则无不成”。在AI基础设施从千卡走向十万卡、百万卡的进程中,通信与算力的边界正在消失,光互联、统一内存编址和集群操作系统将成为下一阶段产业竞争的核心地带。
热门跟贴