AI服务器的内存账单,正在被一种原本装在手机里的产品改写。

8月11日,外媒Wccftech援引美国银行(BofA)测算称,英伟达面向Vera Rubin Ultra NVL144的Kyber机柜将配置124.4TB HBM4E,成本约为250万美元;同柜216TB LPDDR5X虽然单价更低,但总成本趋近280万美元,超出前者约12%。

打开网易新闻 查看精彩图片

LPDDR5X原本主要用于手机等移动设备,例如iPhone 17 Pro搭载12GB LPDDR5X内存。如果做一个换算,Kyber单柜所使用的相当于约1.8万部手机的运行内存总量。

从手机到服务器的迁移

这并不是LPDDR第一次走进数据中心。早在Grace CPU时代,英伟达就已经开始用LPDDR5X代替传统服务器使用的DDR。

三年后,新一代Vera CPU内存不仅形式发生改变——SOCAMM2(Small Outline Compression Attached Memory Module 2,小型压接式内存模块)将原本固定式设计升级为可拆卸、可维护的服务器内存模块,单颗CPU的LPDDR5X容量也从GB级别提升至TB级别(1TB=1000GB)。

这个原本为手机等端侧设备而设计的兼顾带宽、容量和功耗的产品,正在迎来和HBM相似的境遇——越来越贵的同时,也越来越稀缺。

为何曾经的手机内存能跑进AI服务器?

答案在于CPU的核心数持续增加,以及智算、超算等工作负载的数据量不断攀升。这些压力传导到内存端,转化为对更大容量和更高带宽的明确需求。

然而,传统服务器主内存所采用的DDR5 RDIMM(寄存式双列直插内存模块),很难在控制功耗的同时,满足CPU对极致内存吞吐能力的追求。

于是,英伟达开始另辟蹊径,瞄准LPDDR这类低功耗手机内存。首款数据中心CPU Grace首次应用的LPDDR5X,围绕CPU布置了多个内存通道,提供远高于手机场景的总带宽。

按照官方2023年披露的数据,相比当时典型的服务器DDR5内存方案,Grace的LPDDR5X在成本相近的情况下,带宽最高可提升53%;提供同样1GB/s带宽,所需的功耗也只有前者的约八分之一。

美光与Meta最新的联合测试更直观地展示了瓶颈如何被LPDDR5X解决:一项AI数据整理任务的吞吐量,在内存速度提升后增加了11%;当容量翻倍、避免中间数据频繁写入SSD后,大数据分析任务速度甚至提高到原来的2至3倍;在其中一项AI任务中,LPDDR5X本身只占整机功耗的6.8%。

模块化改造:从固定到可拆换

当手机内存被搬进服务器,性能与功耗之间的平衡得以被维持。但下一个问题随之而来:传统移动设备的安装方式,未必适配服务器的工作节奏。

为了缩短信号路径、降低传输损耗,Grace将LPDDR5X固定在CPU计算模块上。这种设计往往意味着LPDDR5X一经损坏,就需要更换承载内存的整块计算板,并不符合服务器需要连续运行多年、故障部件必须能在现场快速替换的特性。

除此之外,供应端的灵活性也被削弱。在整机厂必须提前锁定内存容量和颗粒规格的情况下,已交付的服务器难以完成后续的迭代升级。一旦某种颗粒供应紧张,厂商也很难像更换RDIMM那样自如调整配置。

于是,将LPDDR5X模块化的SOCAMM应运而生。但它没有继承DDR5 RDIMM的布局思路,而是借鉴了轻薄本内存的CAMM(压接式内存模块)设计:传统RDIMM采用竖向插槽,虽然拆换方便,但由于内存条较高,会占用CPU周围的立体空间;平铺加压接的方案,不仅保留了可拆换性,还大大降低模块高度,为CPU周围的散热部件和更多LPDDR5X模块留出空间。

据美光测算,同等容量下,首代SOCAMM可提供RDIMM 2.5倍以上的带宽,占用面积约为后者的三分之一;其后续SOCAMM2的功耗也约为等容量RDIMM的三分之一。

在机架总能耗的约束下,SOCAMM的低功耗优势还在被放大。英伟达官方数据披露,一个GB200计算节点中的4个GPU模块(含计算及其配套HBM)最大功耗合计5.6kW,约占该节点6.7kW最大功耗预算的84%。当GPU模块已占据AI机架的大部分用电预算,CPU内存的扩展不得不精打细算,而SOCAMM恰好击中痛点。因此,也不难理解为何英伟达会连续押注从LPDDR到SOCAMM的CPU内存赛道。

不过,高带宽、低功耗、大容量的性能优势只说明了这条路线的可行性,却解释不了它正在发生的另一面——当AI系统动辄消耗TB级别的LPDDR用量、更多厂商陆续下场押注,过去主要由手机周期主导价格和库存的逻辑,开始发生改变。

容量需求暴涨,供应却趋紧

CPU侧LPDDR的扩张,已经直接写进了英伟达新一代产品规格。3年前开始商用的Grace CPU,单颗最高配置480GB LPDDR5X;到了Vera,这一数字提高到1.5TB,是前者的3倍多。

放到整套系统里,Vera Rubin NVL72的36颗Vera CPU合计配置54TB LPDDR5X,而美国银行对下一代Kyber机柜的测算进一步来到216TB。

容量一路向上,并不只是为了堆参数,而是为了匹配计算系统日益繁重的工作量。Agent兴起后,CPU要承担的工具调用、代码运行和数据库访问不再是一次性动作,而是在单次任务中反复发生,并行任务也随之增加。CPU需要处理和搬运的数据更多,对内存容量和带宽的要求自然提高。

CPU与GPU之间的内存分工也同步在施压。通过一致性互连,一部分原本集中在GPU侧的容量压力被转移到CPU侧,有限且昂贵的HBM空间则留给对带宽更敏感的数据。

当两股需求最终都指向更大的内存容量和更高的传输带宽,存储厂也在顺着这一趋势继续提高SOCAMM容量。目前三大DRAM原厂均已进入SOCAMM2量产阶段,美光还采用单颗32Gb(约4GB)的LPDDR5X裸片,将单模块SOCAMM2容量进一步提高到256GB,目前处于客户送样阶段。

英伟达也不是唯一开始在服务器CPU上扩大LPDDR使用范围的芯片厂商。今年4月,AMD表示计划在2027年推出支持LPDDR5X SOCAMM2的CPU,并将其作为未来Instinct GPU的配套主机。TrendForce同时称,英伟达之外的ASIC开发商也已经开始评估低功耗DRAM。

其预计,到2028年至2030年,AI服务器生态甚至可能超过智能手机,成为全球最大的LPDRAM(所有低功耗的内存产品的统称,包含LPSDRAM、LPDDR4、LPDDR5、LPDDR5X等)单一终端市场。

SOCAMM本身也在从英伟达率先采用的方案走向更广泛的行业标准。今年6月,全球内存与固态技术标准的制定机构JEDEC正式规定SOCAMM2的电气与机械要求。这意味着更多厂商可以按照统一规范开发模块和平台。

但在新买家尚未大规模入场的当下,SOCAMM所依赖的LPDDR5X供应已经趋紧。TrendForce今年1月指出,DRAM原厂正把先进制程和新增产能更多转向服务器内存(主要指传统DDR5路线)与HBM,留给LPDDR等其他产品的供给空间随之收窄。除此之外,即便手机市场处在传统淡季,LPDDR的供应格局也在发生变化。