彻底打破英伟达垄断,华为昇腾384超节点已商用750多套

根据财联社的报道,华为在2025年发布的昇腾384超节点,一共卖出去了750多套。同时,新一代昇腾950超节点的真机,准备在2026世界人工智能大会上公开亮相。

打开网易新闻 查看精彩图片

这超节点到底是个什么东西?它是一体化的整机柜集群,靠华为自己搞的高速互联硬件,把几百颗AI芯片深度绑在一起,在逻辑上融合成一台巨型的超级计算机。

我们就拿昇腾384超节点来说,一个完整的单元里头,固定装着384颗昇腾910C算力芯片,再配上专用的总线交换柜、液冷散热,还有全光400G高速链路,是一套独立的、标准化的巨无霸算力单元,这样用户就可以直接批量采购。

打开网易新闻 查看精彩图片

说白了,超节点就是中国用来对抗英伟达先进AI芯片的一套创新方案。而华为昇腾的大规模出货,已经能证明,中国正在搭起属于自己的人工智能生态系统。

对抗英伟达芯片先进制程,华为打造超节点方案

在AI算力基础设施这块,英伟达走的路子很明确,就是死磕先进制程工艺和单芯片的极限性能。你看它家的H100、B200这些产品,用的是4纳米甚至3纳米的制造工艺,一颗芯片里塞进去800多亿到2080亿个晶体管,再配上高带宽内存,靠硬件堆起来的带宽每秒能达到好几TB。

打开网易新闻 查看精彩图片

这套玩法的核心逻辑,就是利用几乎没有限制的半导体制造资源,先把单张加速卡打造成一个极端强悍的算力点,然后再用互联技术往外扩展,拼出一个大集群。

可华为被美国的制裁卡住了脖子,没有办法让台积电用自己最先进的制程给自己代工。

不仅如此,就连高带宽内存这类关键零件也被美国断了供。你像昇腾910C是华为在这种受限条件下搞出来的最新一代高算力芯片,用的是中芯国际N+2这类7纳米级别的工艺,单芯片的晶体管规模虽然比起910B涨了很多,但跟台积电3纳米、4纳米的密度比起来,还是差着事。

面对这种制造上的不足,华为没有去硬追单卡的指标,而是直接把竞争的方向拉到了系统架构层面,搞出了超节点这个方案。

超节点的本质,就是用一大堆中等制程芯片,通过极高的通信速度,搭出一个紧耦合的计算域。华为没把算力竞争定义为芯片对芯片的单挑,而是用机柜甚至多机柜级的一体化设计,拿几十上百颗昇腾处理器,通过自己研发的高速互联通道、光纤和专用交换芯片,聚合成一个逻辑上的巨型处理器。

华为这条路走得通,是因为模型大到万亿参数以后,计算的困难全变了。过去大家习惯用一台台装八张卡的服务器去堆,但模型切块后,卡和卡之间要交换的数据量会变得特别大。这个时候用普通网络或专用高速网络,虽然带宽不低,但每次传输都有延迟,经过多个节点还会损失速度,最后大批算力都干等着数据同步,实际根本跑不满。

打开网易新闻 查看精彩图片

这时候,真正能用出来的算力不再是单张卡理论上能跑多快,而是取决于通信速度、内存共用效率,还有集群调度器能不能做好全局安排。

华为超节点就是针对这些困难来设计的。它改变了卡和卡之间的连接结构,让更多卡可以直接互通,甚至每张卡都能快速跟其他卡交换数据,而且所有卡的内存可以当成一整块来用。

你像一张昇腾芯片能在硬件层面直接读写同一个组里其他卡的高速内存,省掉数据在不同机器之间搬来搬去的步骤。这样一来,把大模型切开、同步的开销就降下来了。

可以说,华为不再只盯着把单个芯片做得更精密,而是把系统最终能跑出来的实际效率当成核心标准。

不过,光有高速互联的硬件还不够。如果上面那层软件没法把这种互联能力变成真实算力,芯片堆得再多,也只会出现卡越多、实际利用率反而越低的局面。你像以前从千卡扩到万卡,利用率常常从超过九成掉到五成以下。

为此,华为做了一套跟超节点深度配合的软件,这款叫CANN的软件,它负责把计算任务和通信安排融合在一起调度,所以通过超节点的方案,在训练千亿甚至万亿参数模型时,实际算力发挥的比例一直保持在八成以上。

打开网易新闻 查看精彩图片

这个效率已经赶上,部分地方还超过了同样规模的英伟达A100集群。这样一来,即使单张芯片的制造工艺不占优势,依靠系统整体的设计,集群的实际表现依然非常突出,弥补了单卡的局限。

而华为昇腾这样大规模出货,正好证明了,中国确确实实在构建自己的生态系统。

华为超节点大规模出货,构建中国自己生态系统

华为这750套超节点,已经跑在了金融、医疗、工业、政务这些领域的真实生产系统里,构成了生态能够长起来的物理基座。

靠着这750套超节点带来的海量落地场景,华为跟超过3000家合作伙伴一块搞联合开发和适配。到2025年,已经积累出7000多套面向行业的AI解决方案,覆盖超过60种细分业务场景。

比如在金融领域,已经有商业银行把智能风控大模型部署在昇腾超节点集群上,取代了以前基于进口硬件的训练推理架构。那家银行拿历史交易数据做增量训练之后,模型揪出欺诈交易的响应时间缩短到了毫秒级,而且训练用的算力再也不受外部供应链波动的影响。

打开网易新闻 查看精彩图片

还有在医疗领域,多家医学影像企业跟三甲医院合作,基于昇腾算力跑病理切片分析模型,针对宫颈癌、肺结节这些病种的辅助筛查系统,已经在几十家医疗机构里用起来了,其中部分场景的性能,已经可以做到跟使用进口方案的持平。

这些行业客户在进行智能化改造的时候,不用再从底层驱动开始去适配国产芯片,可以直接在7000多套方案库里,找到相近场景的成熟架构,拿过来复用,开发周期从原先的几个月压缩到了几个星期。这种能直接用的方案密度,拉低了中小企业使用国产大模型的门槛。

打开网易新闻 查看精彩图片

跟海量出货同步发生的,是产业链围绕昇腾超节点形成了一套完整的生态体系。

你像在服务器整机这块,国内十几家制造商已经基于昇腾超节点架构,批量生产不同配置的服务器,能提供从推理一体机到大规模训练集群的全套产品,交付环节完全标准化。

还有你像光通信企业,专门针对超节点高密度互联的需求,提供不同的产品方案,保证了节点内部的通信带宽能跟得上计算吞吐。

还有你像大模型公司那边,国内很多主流的大模型,都已经完整适配了昇腾平台,还在部分模型结构上实现了推理过程的优化,这样就跑得更顺了。

这就构成了覆盖上下游的完整生态系统。厂商不用再针对每一款国产芯片各自为战,而是统一面向昇腾超节点架构去规划产品路线图,接口、协议与计算库保持一致。带来的产业协同效应就是,供应链上下游的联合调试成本大幅下降,硬件迭代和软件更新可以同步展开。

现在全国已经有上百所高校在人工智能相关课程里头,引入了昇腾AI教学内容,基于昇腾开发者套件和云资源搞教学实验,这样就会给华为注入源源不断的开发人才。华为公布的数据显示,昇腾工具链上的注册开发者数量已经超过百万,每年举办的昇腾AI创新大赛和应用开发者大赛,吸引几千支队伍参加,产出大量面向制造业、农业、科学研究的具体应用。

打开网易新闻 查看精彩图片

过去,国内大多数AI开发者的技术栈都建立在英伟达的CUDA生态系统上面,现在华为提供了一套全新的生态系统。人才培养、工具链、应用开发这三样东西一旦形成闭环,就意味着即使外部的计算生态再起变化,国内AI开发的延续性也不会断层。

把这些事实放在一起看,750套超节点落地,不是华为单项产品的销售数字,而是承载了一个由硬件整机、光互联、算法模型、行业应用、算力运营和高教体系共同组成的生态系统。

这个系统的运行逻辑,已经跨过了“能用”的边界,进入了规模化部署的阶段,表现在行业方案可以直接复用、产业链围绕固定架构进行协同、人才供给可以独立转起来。

打开网易新闻 查看精彩图片

而华为昇腾超节点的发展,也让中国AI产业避免了被国外卡住脖子的风险。

华为超节点,让中国AI产业避免卡脖子

大家都知道,美国对中国人工智能产业的封锁,是全方位的,而且强度再不断加大。

从芯片本身来看,2022年10月起,美国商务部工业安全局就把A100、H100这些高性能GPU列进了出口管制清单,后面又进一步限制了性能更强的B200等产品。

还有在芯片制造环节,极紫外光刻机对华禁售早就开始,先进制程的代工渠道直接被切断。在存储层面,美国又联合盟友对高带宽内存实施管制,限制HBM3及以上的产品卖到中国来,直接掐住了高端加速器内存带宽的来源。

打开网易新闻 查看精彩图片

还有软件生态上,CUDA形成的开发者锁定本身就是一道高墙,大量模型训练和推理框架跟它深度捆绑,想换掉的成本极高。系统集成这块,英伟达DGX SuperPOD这类高端整机柜方案也被列进了断供范围,让国内没法直接拿到一体化集群构建能力。

可以说,美国的目的很简单,全球AI这块大市场,只能由美国来垄断,美国不允许中国的AI产业发展起来。

而就在这个时候,华为拿出来一套全新的AI生态系统。

简单来说,华为昇腾超节点,不是拿一颗国产芯片去简单替换一颗受限的GPU,而是一整套从头到尾自主、可以大规模商用的体系化对抗方案。

大家要知道,就算是美国没有对中国制裁,国内医疗、、国防科技、交通、金融这些国家核心领域的大模型训练也不可以依赖国外的零部件。

这些领域对业务连续性和安全性要求非常苛刻,算力基础设施绝对不能建在一个被别人捏着脖子的供应链上头。

所以华为的这套技术方案就给中国独立自主发展提供了可能性。

你像深圳龙岗区部署的城市治理智能体,就跑在昇腾超节点上。单套384卡集群接进去,实时分析全区25万路摄像头数据,支撑洪涝应急响应、校园安防监测、12345政务热线智能分拨,还有城市全域风险研判这些业务。所有政务数据都在国产算力上本地闭环处理,避开了使用海外设备可能带来的数据泄露和断供风险。

打开网易新闻 查看精彩图片

你想想,如果我们用的是美国的芯片、技术方案,那这些核心数据是不是存在泄密的可能性。

现在,华为还在持续升级超节点技术方案,产你像下一代昇腾950超节点,会基于最新的昇腾950DT芯片构建,单个机柜集成64张加速卡,由16台计算柜组合在一起,总共1024张卡通过高速互联组成一个超节点。华为把它定义为业界最大规模的超节点。跟之前384卡的集群相比,总算力规模和单节点卡数都猛地扩展了一大截,能更好地去匹配万亿参数级别大模型的分布式训练需求。

到时候,中国的AI产业在全球的影响力又会提升一大截。