AI工厂按兆瓦来建,甚至按吉瓦来建。每一兆瓦工厂的成本大约6000万美元,运营商只有在能清楚看到投资回报的前提下,才会在这个量级上投入资本。有三件关键的事决定AI工厂的回报。

一项能力无法完全抵消另一项的短板。如果工厂只能卖出它能生产的一部分,高产出能力就没有多大意义。如果满负荷运转一年就停摆,高需求也没有多大意义。这三者也不是彼此独立的。一座能运行更多种类工作负载的工厂,会找到更多需求,从而年复一年地保持产出。

打开网易新闻 查看精彩图片

NVIDIA的AI工厂在设计上就是要同时最大化这三件事。它们包括:

全栈的工程协同设计最大化AI工厂吞吐量,持续的软件优化让已出货的硬件在多年之后依然保持生产力。NVIDIA CUDA-X库让工厂可以运行任何加速工作负载。标准化架构则让这一切对任何运营商都触手可及,可以从经过验证的参考设计直接部署。

电力是AI工厂的硬约束。这让每兆瓦每秒token数成为决定产出能力的核心指标。在固定的电力预算内产出更多token,意味着更多收入。更低的每token成本,意味着更高的利润空间。

SemiAnalysis AgentX的数据显示,NVIDIA Vera Rubin NVL72系统每兆瓦吞吐量比NVIDIA GB300 NVL72高出30倍以上,在DeepSeek V4 Pro模型上,每百万token成本最多低45倍。这种量级的提升,来自全栈的极致协同设计:从模型和工作负载,向下贯穿软件,再到计算、网络和内存,全部放在一起优化。

由此引出两个问题。第一个问题:如果每一代都让token变得极其便宜,对算力的需求会不会萎缩?

更便宜的token会让更多用例变得经济可行,而这些用例消耗的token,比效率节省下来的还要多。

第二个问题关于耐久性:如果每一代都比上一代强这么多,老一代会怎样?

并非所有工作负载都需要最新的系统。合适的匹配取决于工作负载的复杂度和形态,这正是上一代产品在新一代到来之后依然能持续创造收入的原因。

NVIDIA A100 GPU于2020年出货,六年之后仍在商业服务中运行,持续体现其经济价值;CoreWeave近期将2020年首次推出的设备预订延长到了2029年。多年来,每一家主要运营商都延长了其服务器的折旧年限。折旧年限本质上是对硬件何时停止赚钱的猜测,而这个猜测一直在往后移。2026年9月的一份Sprout分析《数据中心GPU的生产性寿命》,追踪了这一时间表在每一家主要运营商那里的变化。

Barkr根据这些系统的转售价格,把八卡H100系统的使用寿命定在五到六年,把GB300 NVL72定在九到十年。Silicon Data的数据显示,一块六年前的A100 GPU仍值其原价的四分之一,而按五年折旧年限,它在一年多以前就已经归零。Ornn Data发现,市场上租用A100 GPU,五年期合约的价格是单月合约的80%。

CUDA是NVIDIA GPU的编程软件平台,它跨代运行,所以当新架构到来时,运营商已经拥有的东西不会变成废铁。持续的软件和内核优化,让现有硬件能做的事情不断变多。

同一个平台运行机器学习、深度学习、生成式AI、推理、代理式AI和物理AI。每一种新的工作类型,都出现在已经安装好的硬件上。

这就是通用性。一个系统能承担的工作种类越多,它找到工作的持续时间就越长。

为一种工作而建的工厂,是在押注这种工作会一直存在。能运行一切工作的工厂,即使工作发生变化,也依然有用,依然能创造收入。

NVIDIA AI工厂运行每一种AI模型——开源的和专有的——覆盖语言、视觉、生物学、物理学和机器人学。它们运行每一个阶段,从数据处理到预训练、后训练和推理。它们也运行在每一个地方,从超大规模和AI云,到主权项目、企业数据中心和边缘。

并非所有工作都是构建和运行AI模型。同一套基础设施还运行数据处理、科学计算、仿真、图形等。

所有这些工作负载,无论是不是AI,都归结为同一种并行数学,而NVIDIA GPU正是为同时跨数千个核心运行这种数学而构建的。CUDA就是为什么一颗芯片可以模拟光线、折叠蛋白质并预测下一个token。超过1000个现成的CUDA-X库位于其上,覆盖从深度神经网络、计算光刻和量子电路仿真到向量搜索和气候建模的一切,超过1000万开发者在这些库上构建。

这就是为什么NVIDIA GPU是通用加速计算,而不是为单一工作负载定制的ASIC。通用并不意味着泛泛:Tensor Core和Transformer Engine把AI优化的硬件放进可编程架构,在一颗芯片上同时提供专用性和灵活性。一个架构运行所有这一切,正是保持高利用率以及随之而来的回报的原因。

这种通用性在客户的 production 中有所体现:

在AI之外也是如此。Dassault Systèmes为Wichita State的飞机认证和Lucid Motors的车辆设计提供虚拟孪生仿真支持。Unilever用数字孪生而非拍摄来构建产品图像,把生产成本减半。

这里列举的例子不可能完整——这正是重点。

NVIDIA AI工厂被设计为高产出、耐久和通用:更赚钱的token、更长的使用寿命和更深的需求。这就是最大化其回报的方式。

了解更多关于NVIDIA AI工厂的信息,请收看NVIDIA创始人兼CEO黄仁勋在GTC Berlin的主题演讲。