DRAM供应持续紧张,已将AI巨头逼到拆旧服务器回收内存的地步。
谷歌供应链基础设施高级总监Nikhil Cherian近日透露,AI行业已从算力受限快速转向内存受限,高性能内存目前占单台AI服务器物料成本的约75%。
据Cherian介绍,为突破内存瓶颈,谷歌在软硬件两端同时发力,硬件层面甚至建立了内部回收供应链,将退役服务器拆解后回收可用的DDR4内存模块。
Cherian坦言,谷歌专门设计了硬件转接器,使上一代DDR4内存能够连接到新一代AI服务器上,并且正在专门重新导入退役服务器以拆取其中的DDR4模组。
这意味着原本应使用DDR5的新AI服务器,在部分情况下不得不降级使用回收的DDR4。
打开网易新闻 查看精彩图片
软件层面,谷歌持续优化底层函数库、模型架构和KV Cache压缩技术,试图降低单位算力的内存消耗。
今年谷歌推出了两款TPU ASIC,分别是面向训练的TPU8t和面向推理的TPU8i,其中TPU8i每颗芯片配备288GB HBM3e,提供8.6 TB/s内存带宽,并集成384MB片上SRAM用于存储活跃的KV缓存,减少对外部系统内存的查询需求。
TPU8i服务器采用谷歌自研基于Arm架构的Axion处理器替代传统x86主机CPU,依赖高速DDR5内存架构处理数据预处理等主机级任务。
然而即便如此,谷歌仍被迫在部分场景中以回收的DDR4替代DDR5,足见当前DRAM供应紧张程度之深。
热门跟贴