8月26日,英伟达在发布最新财报的同时,又往NVLink上加了一块重要拼图:新版NVLink Fusion开始加入NVHBM高带宽内存,而且继续向云厂商的自研芯片开放。类似于亚马逊这样的公司,以后可以把自己的AI芯片接进英伟达的高速互联和机架体系。

英伟达这些年越来越清楚的一件事:未来的AI市场,不可能永远只有英伟达自己的GPU。

既然别人一定会造芯片,那么英伟达就要想办法控制另一样东西——这些芯片连接在一起以后,用什么方式工作。

一、GPU越多,通信越容易拖后腿

早期谈GPU,大家关心的是单卡性能。现在一个大型模型往往被拆到几百、几千甚至几万块GPU上同时训练。

每块GPU负责其中一部分计算,算完以后还要不断交换梯度、参数和中间结果。问题是,某块GPU已经完成计算,但它需要的数据还堵在网络里,这块GPU只能等。机器越多,这种等待越容易发生。

而GPU又是整个数据中心最贵的设备之一。

几万块GPU如果因为网络问题经常处于等待状态,再昂贵的芯片也发挥不出应有的效率。

英伟达这些年不断补网络能力,就是为了减少这种等待。

靠近GPU的地方用NVLink和NVSwitch,把几十块GPU连得像一台机器内部的计算单元;机架之间使用InfiniBand或者Spectrum-X Ethernet;再加上ConnectX网卡、BlueField DPU和GPUDirect,让数据尽量少绕路。

2020年英伟达花近70亿美元收购Mellanox,现在回头看,这笔交易的重要性已经远远超过“多了一块网络业务”。

它补上了英伟达从芯片公司走向数据中心公司的关键一步。

二、英伟达看上的,并不只是交换机生意

英伟达最新一个季度的网络业务继续创下纪录,Spectrum-X Ethernet同比增长到2.6倍。如果只是看销售额,很容易把它理解成英伟达开始和Broadcom、Arista、Cisco抢交换机市场。

这当然是其中一部分,但不是全部。

英伟达更在意的是,一座AI数据中心建起来以后,自己究竟能够卖进去多少东西。

几年前答案很简单:GPU。现在已经变成GPU、CPU、NVLink、NVSwitch、网卡、DPU、InfiniBand、Ethernet、机架和软件。

客户以前是买英伟达的芯片,再去找别的公司配服务器和网络。现在英伟达越来越希望客户直接买一套已经设计好的AI计算系统。

这两种生意差别很大。

前一种生意里,英伟达负责一个核心部件;后一种生意里,它开始参与整座AI数据中心的架构设计。

网络的价值就在这里。它把原本分散在不同厂商手里的设备,重新串进了英伟达自己的体系。

三、英伟达也开始面对“开放标准”的围攻

当然,其他公司不会愿意一直按照英伟达制定的方式建设AI集群。

Broadcom正在用Tomahawk系列高速以太网交换芯片猛攻AI网络。最新的Tomahawk 6交换容量已经达到102.4Tbps,并且开始同时覆盖Scale-out和Scale-up场景。

更值得关注的是UALink。

AMD、Intel、Google、Meta、Microsoft、AWS、Apple、Cisco等一批公司都已经加入这个联盟。

这些公司的目标并不复杂:给AI加速器做一套开放的高速互联标准。

如果以后AMD GPU、Google TPU、AWS Trainium以及其他AI芯片都可以通过一套通用标准高速互联,那么云厂商就不需要过度依赖NVLink。

这其实碰到了英伟达很敏感的一块地方。

CUDA之所以重要,不只是因为它好用,还因为大量开发者和软件围绕它形成了习惯。NVLink如果也能形成类似的生态,那么英伟达控制的就不只是GPU,还包括GPU之间的连接方式。

UALink要做的,恰恰是阻止这种局面完全形成。

四、英伟达的优势在于,它同时懂计算和网络

网络行业并不缺高手。

Broadcom的交换芯片很强,Arista在大型数据中心网络里积累多年,AMD也有自己的GPU和计算平台。

英伟达的特殊之处,是它手里的东西能够连成一条完整的链。

CUDA负责GPU计算生态,NCCL处理大量GPU之间的集合通信,GPUDirect让网卡可以直接访问GPU内存,NVLink负责近距离高速互联,InfiniBand和Spectrum-X再把计算扩展到更大的集群。

于是英伟达设计网络时,可以直接从GPU的工作方式出发。

它知道GPU什么时候需要交换数据,交换的数据有多大,哪些通信最容易造成等待,也知道通信慢下来以后,会怎样影响整个训练任务。

单独做好一块交换芯片并不容易,但英伟达现在做的事情更复杂:它在同时调整GPU、通信软件、网卡和交换网络,让它们按照同一套系统目标工作。

这也是为什么NVLink Fusion最近开始主动接纳别人的AI芯片。

英伟达大概已经接受了一个现实:未来云厂商自研芯片只会越来越多。

与其要求所有人继续购买英伟达GPU,不如让这些芯片也尽可能进入英伟达的网络体系。

亚马逊可以有Trainium,Google可以继续发展TPU,其他公司也可以设计自己的XPU。

但只要这些芯片仍然需要NVLink、英伟达的交换网络、机架和软件,英伟达在AI基础设施里的位置就不会轻易动摇。

结语

过去几年,谈英伟达的核心能力,人们首先想到GPU,然后想到CUDA。

现在还应该加上网络。AI计算规模继续扩大以后,一颗芯片的性能虽然重要,但它已经很难单独决定一套系统的效率。

十万块GPU放在一起,怎样交换数据,怎样避免拥堵,怎样减少等待,最后都会影响这些昂贵芯片到底能发挥出多少性能。

所以英伟达不断向网络深入,并不是突然想做一家交换机公司。

“当未来数十万甚至上百万块AI芯片被连接成一台超级计算机时,这台机器按照谁的架构运行。”

这才是NVLink背后真正值得关注的竞争。