很多人到现在还在说国产算力卡比英伟达差得远,根本追不上,结果上周华为全连接大会刚扔出来的一堆技术,直接让所有人反应过来:之前我们全都被 “单卡性能” 这个思路给带偏了。

现在 AI 圈最缺的根本不是什么花里胡哨的新模型,就是实打实的算力。训练要算力,模型火了用户多了推理更要算力,高端英伟达卡买不到,低端卡还要加价排队,几乎所有国内大模型厂商都被这事儿卡得难受。所有人一开始都死磕单卡参数,结果拼来拼去发现单卡性能确实有差距,直到有人换了个思路:既然单卡拼不过,那我直接把堆卡这件事玩到极致不就行了?这个现在算力圈最火的玩法,就是超节点。

打开网易新闻 查看精彩图片

最早超节点是英伟达搞出来的,早年大家傻呵呵把一百张显卡堆在一起,以为能拿到百分百的算力,结果实际能用的连四成都不到。要么是卡之间传数据的带宽不够,数据跑不动,要么是各家攒的服务器没有标准,稳定性差到离谱。英伟达靠自研的高速互联协议加整套软硬件适配,直接把算力利用率干到了八成,开箱即用的体验让当时全行业都觉得,这招没人能抄明白。

结果咱们反而把这条路走通了,而且玩得比谁都狠。去年华为 CloudMatrix384 出来的时候还没多少人注意,刚好撞上 DeepSeek 爆火,刚好匹配大模型推理需求直接带火了整个概念。今年上半年昇腾 950 组成的超节点就已经做到了单机柜 64 卡,16 个机柜共 1024 张卡统一编址,纸面参数已经能和英伟达最新的 GB200 超节点对打。上周华为更狠,直接把昇腾 960 的超节点规模干到了 4096 张卡,明年一二季度就能交付。

很多人只看到了昇腾卡本身,根本不知道华为这套超节点的灵魂根本不是卡,是他们自研的灵衢协议。本来华为就是干通信出身的,直接把服务器内部、节点之间、集群之间的所有通信协议全给统一了,不像英伟达还要分层转数据,延迟低了一大截,还直接把这个协议开源给全行业用,相当于直接把超节点最核心的堵点给捅破了。

打开网易新闻 查看精彩图片

这次更炸的是他们搞出了业内第一个量产的 NPO 光互联产品 Hi-One。之前全行业都在炒光模块,几万颗光模块堆在机柜后面,又费电又容易出问题,华为直接把光引擎塞到离芯片 5 厘米以内的地方,用 5500 个 Hi-One 就能替代原来 4.8 万颗 800G 光模块,直接砍了 90% 的数量,功耗降了信号还更稳,这波操作直接给整个行业看傻了。还有专门给 AI Agent 准备的鲲鹏超节点,最多支持 4096 个节点,沙箱启动速度比传统服务器快 30 倍,直接用架构把 CPU 的短板给补上了。

很多人说咱们没有什么颠覆性的黑科技,但是别忘了,超节点拼的本来就不是单卡性能,是整套系统的架构优化能力。单卡不如人,我就堆一万张十万张,把互联、存储、调度所有细节全抠到极致,最后出来的有效算力根本不差。之前老黄公开说 DeepSeek 跑在华为芯片上对美国是可怕的结果,当时所有人都觉得他是在演,想让放开卖卡赚大钱,现在看完这套组合拳,没人敢说这话是假的。

打开网易新闻 查看精彩图片

现在剩下的坎无非就是量产和生态,但是比起几年前连卡都买不到的日子,现在已经走出来太远了,而且不光华为,其他国产算力厂商也都在往超节点这条路上冲,卡脖子的坎,咱们换个赛道就给绕过去了。你们觉得再过两年,国产算力能不能真正追平英伟达?欢迎在评论区聊聊你的看法,觉得说的在理的别忘了点赞收藏转发给身边搞 AI 的朋友看看。