前不久NVIDIA刚出货的Rubin Ultra GPU,不少拿到手的用户都懵了——说好的1.5TB满血内存,部分型号只有768GB。网上瞬间炸开锅,不少人都猜肯定是存储产能跟不上,英伟达迫不得已砍配置凑数。哪想到官方回应直接推翻了所有人的猜想,这波根本不是产能妥协,是人英伟达主动下的一步大棋。

打开网易新闻 查看精彩图片

大家都盯着那几百GB的容量差吵来吵去,没多少人注意到这次Rubin Ultra换了全新的96GB SOCAMM模块。这种模块化内存设计,能让厂商根据客户实际需求灵活搭配容量,不用再像前代产品那样绑定死固定规格。现在产品线早就不是原来只有单一SKU的样子,从8层堆叠到12层堆叠的HBM4系列都有得选。不同配置对应不同的容量带宽和价格,从小规模推理到超大规模训练全给你覆盖到了。

搁以前想买高端AI GPU,你只能被动接受厂商给的固定配置,哪怕你用不上那么多内存也得掏钱。现在不一样了,你完全可以照着自己的业务负载挑合适的硬件,根本不用为用不上的冗余存储交智商税。说穿了这就是把选配置的主动权递回给用户了,不再是厂商拿统一规格框住所有需求。

这次同步出货的Vera Rubin NVL72平台也很有看点,整台机柜整合了72颗Rubin GPU和36颗Vera CPU,用的是第三代MGX架构。和上一代Blackwell平台比,它只需要四分之一的GPU数量,就能完成同等规模的AI训练任务。算下来每百万Token的推理成本直接砍到原来的十分之一,相当于直接打了一折。

打开网易新闻 查看精彩图片

这组数据有多狠,只有天天搞大模型推理部署的朋友才懂。之前多少企业为了把推理成本压到能赚钱的线以下,来回在模型精度和响应速度之间做减法,愁得头发都掉了。现在硬件直接给你把成本打下来,可操作的空间一下就大了好多。

现在这套NVL72平台已经全面量产了,全球AI数据中心不用再等大几个月的定制排期,直接就能拿到标准化的高性价比算力集群。之前好多卡在成本关口走不下去的大模型落地项目,这下直接有了商业化的可能。相当于给行业开了新口子,好多之前想都不敢想的项目,现在都能拉出来试试水了。

巧的是,英伟达这边刚启动出货,华为那边也扔了个大招,2026年第一季度正式推出昇腾950PR加速卡和Atlas 350 AI服务器。在FP4低精度推理场景下,这款加速卡的单卡算力直接做到国际主流旗舰GPU的2.87倍,这个成绩放到圈内已经相当能打。同期发布的Atlas 950 SuperPoD超节点集群,搭载自研“灵衢”全光互联协议,直接把AI算力利用率从传统架构的30%提升到了70%以上。这个级别的效率提升,直接戳中了很多海外算力平台长期被诟病的互联带宽瓶颈痛点。

搁以前行业里都默认,高端AI算力市场就是少数海外厂商的自留地,别的玩家根本挤不进来。现在国产超算集群一步步完成商用落地,直接给客户多了一个全新的选择维度。英伟达这次主动放开多配置梯度,说白了就是应对这种新的竞争态势,用更灵活的产品矩阵留住不同层级的客户。

之前高端AI GPU的玩法一直都是“高配高价、低配减配”,用户想要更高算力只能不停往上堆预算,连个中间过渡的选项都没有。现在英伟达把内存配置的选择权交出去,相当于直接打破了过去固定SKU的老定价体系。这种分层配置思路,配合推理成本直降九成的硬件性能,再加上国产超算带来的效率突破,整个AI算力市场的定价逻辑正在被彻底改写。

搁以前算力绝对是头部大厂才能玩得转的重资产,普通的中小科技公司根本碰都碰不起。现在不一样了,算力正在慢慢变成普通科技公司也能轻松负担的普惠资源。门槛降得这么快,连很多业内人都直呼没想到。

打开网易新闻 查看精彩图片

说穿了这次768GB版本的推出,根本不是什么产能不足的权宜之计,是全球AI算力产业走向成熟的标志性信号。硬件厂商不再靠单一顶级规格割韭菜赚溢价,转头用模块化思路覆盖全场景需求,大模型落地的最后一道成本门槛,消失速度比所有人预想的都快。接下来行业真正的竞争,早就不是单卡参数堆得高不高,是谁能给客户拿出性价比更高、适配性更强的完整算力解决方案。

参考资料:新华网 AI算力市场新格局观察