2024年3月,英伟达创始人黄仁勋在GTC上率先提出“超节点”概念。他在台上展示了NVL72系列如何将36个Grace CPU和72个Blackwell GPU装进一个液冷机柜中。与传统8卡服务器节点不同,超节点通过高速互联技术,将大量GPU、CPU从过去多台服务器的协作整合为单个物理节点,也就是黄仁勋所说的“一台超级计算机”。
彼时这一概念并未立刻成为风口,NVL72系列还一度因散热问题推迟交付,被不少媒体质疑画饼。但后来巨头们用千卡、万卡乃至百万卡AI集群的实际行动做出了回应。有媒体报道称,马斯克为了自家xAI找黄仁勋加价插队下单1600台GB200 NVL72服务器机柜,甚至和甲骨文董事长拉里·埃里森一起请黄仁勋吃饭。两年后,黄仁勋才悠悠辟谣:“确实一起吃了饭,气氛也很好,但他们从来没有求过GPU,只需要正常下单就行。”
黄仁勋说的确实也对,因为巨头们现在求的不是GPU,而是装着芯片的AI机柜。今年7月,英伟达硬件工程高级副总裁Andrew Bell透露,通过与十家制造伙伴的合作,每天最高能产出1000个Vera Rubin机柜。大洋彼岸,距黄仁勋提出超节点一年后,华为端出了自家的超节点CloudMatrix 384——14个机柜连接384张卡,卡数是NVL72的5倍多,占地面积是其16倍。据Semianalysis拆解,单个CloudMatrix 384集群BF16性能总体是NVL72的1.7倍,总内存容量是其3.6倍,总内存带宽为2.1倍。
华为点起的这把火,随后一年多里被整个国产算力生态奉为圣杯。仅在刚刚过去的WAIC上,就有20多家企业发布了超节点相关方案。超节点是一门被逼出来的创新。一头是摩尔定律逼近极限锁死单颗芯片性能上限,另一头大模型参数竞争持续推高算力需求。它又是一块诱人的蛋糕,正如从卖芯片到卖机柜的黄仁勋反复说的,英伟达不是卖芯片,而是造超级计算机、开AI工厂的,围绕超节点上下游每个环节皆有利可图。
说超节点是被逼出来的创新并不过分。在杨植麟和月之暗面用近3万亿参数的Kimi K3掀翻硅谷模型生态的同时,阿里云悄悄在微信公众号上认领了K3,表示阿里云灵骏真武M890超节点在Day0就适配了Kimi K3,K3部署在64张平头哥真武M890组成的超节点上。Kimi在47页技术报告中回应了一个关键:大模型Scaling不仅没有饱和,而且部署前后都要投算力。Kimi总结出两条路:部署前预训练阶段,更大参数规模、更多数据量,模型越智能;部署后推理阶段,推理优化、强化学习、Agent长程执行持续拉高算力需求。各家尽管各出奇招提升scaling效率,但前提共识是模型参数规模的军备竞赛没有停止,以每年10倍速度增长,迈入十万亿级阶段。
算力集群规模随之迈向千卡级、万卡级、十万卡级,乃至马斯克和黄仁勋在卷的百万卡级别。传统算力集群通常以一台8卡服务器为节点,通过横向扩展方式连接大量AI服务器构建集群。但模型厂商很快发现性价比不高,因为有三堵墙:大模型MoE架构普及,专家并行和张量并行等策略通信量大,对带宽要求高,传统以太网难以承受;英伟达芯片越强,绝对功耗却上升,单颗B200功耗突破1000W,GB200突破2700W,传统风冷无法满足散热;万级处理器带来故障常态化,Meta训练Llama 3时16384个H100显卡54天内出现419次意外故障,平均每三小时一次。
三堵墙之下,超节点放大了另一个策略的价值:将过去分散在数十台服务器里的成百上千颗芯片,在一个低延迟、高带宽域内整合为逻辑统一的一颗“超级大芯片”,这个工作的地方被称为HBD。超节点的单节点已不再是过去意义上的一台服务器,而是由多台服务器和网络设备共同组成的计算单元。一方面通过内部高速互联,塞进更多GPU可实现更高效互联,GPU间参数交换和数据同步更顺利,缩短大模型训练周期。另一方面,超节点本身是高度集成、预调优的超级计算机,在供电、散热等环节采用更高效技术,降低组网和运维难度。
对国产厂商而言,超节点也是一个被逼出来的务实选择。既然单颗芯片性能存在差距,那就用更多芯片、更快互联的方式,以更高的系统效率弥补单卡差距。这种以系统取胜的策略正是中国科技过往的优势所在。有券商总结:超节点就是中国AI的“韬定律”。
黄仁勋虽然最先提出概念,硅谷大厂AI集群火热,但在实际推进中理想丰满、现实骨感。一边,尽管早早拿出AI工厂路线图、服务器厂商产能拉满,但英伟达下一代AI机柜的量产交付时间总被各种问题卡住。据SemiAnalysis爆料,原计划2023年下半年推出的Kyber NVL144机架架构,因制造工艺问题推迟至2028年。另一边,马斯克的xAI、扎克伯格的Meta都开始出租算力,市场开始质疑算力租赁商的成长性,甚至回到“算力是否建设过度”的老问题。
在中国,各类超节点方案如雨后春笋般涌现,各家在比规模、比参数、比方案,甚至有厂商将今年称为“中国超节点元年”。元年不元年并不重要,市场早已听了太多元年故事,更关键的是为什么中国厂商对超节点如此激进?有三股看得见的手在拉满国产超节点的进度条:超节点为国产芯片提供了一条跳出和英伟达比单卡性能的思路——用Scale Up的方式,以系统级创新弥补单点差距。
热门跟贴