9月17日,华为全联接大会2026期间,华为副董事长汪涛正式推出OceanStor M900 AI记忆存储。

据悉,这款产品面向超大规模数据中心AI推理场景,为超节点提供PB级大容量、TB级高性能的全共享记忆空间,推动AI基础设施从“以计算为中心”,迈向计算、网络与存储深度协同的新阶段,进一步释放超节点算力潜能。

随着大模型迈向10T级参数规模,超节点成为当下AI基础设施建设的必然选择。同时,业界主流大模型的上下文窗口已突破百万词元,多轮推理和复杂任务成为常态,推理过程中产生的KV Cache数据规模持续增长。

问题来了:显存和内存容量、性价比都已经无法满足需求。构建显存、内存与SSD协同的多级存储体系,打造大容量全共享记忆空间,已成为行业共识。

【华为出手:OceanStor M900,给AI推理造“全局记忆池”】

为了突破超长上下文、多轮推理场景的内存容量瓶颈,华为全新推出OceanStor M900 AI记忆存储。

三大核心能力,划重点:

【一、打破容量边界:单集群64PB,单NPU可用KV Cache从GB到TB】

依托灵衢高速互联网络,实现KV Cache的全局池化共享和分级存储,将超节点的KV Cache从显存与内存扩展至SSD。

单集群可提供64PB容量,单NPU可用KV Cache容量从GB级提升至TB级。更多上下文得以保存、共享和复用,大幅提升KV Cache缓存命中率。AI的“记忆空间”被大幅拉高,超长上下文不再那么憋屈。

【二、推理性能跃升:访问时延降90%;带宽40TB/s】

业界首创的CPU、网络、盘控三芯合一架构,提供原生KV语义,实现超节点NPU一跳直通SSD,避免协议转换和CPU转发。

访问时延由ms级降至60μs,缩短90%;单集群可提供40TB/s聚合访问带宽,相比业界方案提升1.5倍。

汪涛介绍,在典型AI编程场景中,OceanStor M900 AI记忆存储可将推理集群Token吞吐率翻倍、首Token时延缩短一半。算力更快转化为生产力。

【三、降低Token成本:SSD寿命提升16倍】

采用业界首创的KV-Aware自适应存储技术,根据KV Cache数据价值预测生命周期,对多模介质上的数据排布进行智能调度,DWPD可从1.5提升至24,意味着SSD介质寿命提升16倍,支撑三年稳定运行。

通过减少介质更换和运维投入,降低大规模AI推理基础设施长期成本,加速人工智能规模化普及。

AI竞赛下半场,拼的不只是算力,还有“记忆”。华为OceanStor M900瞄准的,正是超节点AI推理被内存容量卡脖子的痛点。

Agentic AI时代,存储正在成为AI基础设施的关键一环。接下来,就看这套“AI记忆存储”在超大规模数据中心里如何释放威力了。