上周NVIDIA正式启动Rubin Ultra GPU与Vera Rubin平台出货,不少行业用户拿到手后发现部分型号内存仅768GB,并非此前对外宣传的1.5TB满血规格。很多人第一反应是存储产能拖了后腿,但官方给出的回应完全跳出了常规的缺芯叙事。这不是产能妥协,而是NVIDIA主动调整产品梯度的关键一步。当国产超算集群开始大规模落地,全球AI算力市场的竞争逻辑已经悄悄换了赛道。
很多人盯着768GB和1.5TB的数值差纠结,却没注意到这次Rubin Ultra搭载的是全新96GB SOCAMM模块。这种模块化的内存设计,让整机可以根据客户的实际需求灵活搭配容量,不用再像前代产品那样绑定固定内存规格。
之前NVIDIA Rubin Ultra产品线早期仅有12层堆叠HBM4E单一SKU,现在已经扩展出8层HBM4E、12层HBM4、8层HBM4等多款可选配置。不同堆叠层数的存储模块,对应不同的容量、带宽和成本区间,完全覆盖从中小规模推理到超大规模训练的各类场景需求。
这种灵活度的提升,本质上是把算力部署的主动权交还给了客户,而不是厂商用统一规格的产品去框定所有用户的需求。
这次同步落地的Vera Rubin NVL72平台,整合了72个Rubin GPU与36颗Vera CPU,采用第三代MGX NVL72机柜设计。和前代Blackwell平台相比,它仅需四分之一的GPU数量就能完成同等规模的AI训练任务,每百万Token的AI推论成本直接降到原来的十分之一。
这组数据的分量,只有做过大模型推理部署的从业者才能真正读懂。之前不少企业为了把推理成本压到商业化线以下,不得不在模型精度、响应速度之间反复做取舍,现在硬件层面直接把这个弹性空间给拉大了。
目前这套NVL72平台已经全面量产,意味着全球AI数据中心不用再等漫长的定制化排期,直接可以拿到标准化的高性价比算力集群。之前很多卡在成本关口的大模型落地项目,现在瞬间拥有了商业化的可行性。
几乎就在NVIDIA启动Rubin Ultra出货的同一时间,华为2026年Q1正式推出昇腾950PR加速卡与Atlas 350 AI服务器。在FP4低精度推理场景下,这张加速卡的单卡算力达到国际主流旗舰GPU的2.87倍,性能表现相当亮眼。
同期发布的Atlas 950 SuperPoD超节点集群,搭载自研“灵衢”全光互联协议,直接把AI算力利用率从传统架构的30%提升至70%以上。这种级别的效率跃升,完全戳中了海外算力平台过去长期被诟病的互联带宽瓶颈痛点。
之前行业里默认高端AI算力市场是少数海外厂商的自留地,现在国产超算集群逐步完成商用落地,直接给客户提供了全新的选择维度。NVIDIA这次主动放开多配置梯度,本质上也是在应对这种竞争态势,用更灵活的产品矩阵留住不同层级的客户。
之前高端AI GPU的配置策略一直是“高配高价、低配减配”,客户想要更高的算力只能不断往上堆预算,没有中间地带可以过渡。现在NVIDIA把内存配置的选择权交出来,相当于打破了过去固定SKU的定价体系。
这种分层配置的思路,配合推理成本直降九成的硬件性能,再加上国产超算集群带来的效率突破,整个AI算力市场的定价逻辑正在被彻底改写。过去算力是少数大厂才能玩得起的重资产,现在正在逐步变成普通科技公司也能轻松负担的普惠资源。
回头看,这次768GB版本的推出根本不是什么产能不足的权宜之计,而是全球AI算力产业走向成熟的标志性信号。当硬件厂商不再靠单一顶级规格收割溢价,转而用模块化思路覆盖全场景需求,大模型落地的最后一道成本门槛,正在以比所有人预期更快的速度消失。接下来真正的竞争,早已不是单卡参数的比拼,而是谁能给客户提供性价比更高、适配性更强的完整算力解决方案。
热门跟贴