#头条学堂·分50万元#

在 9 月于上海举行的 HUAWEI CONNECT 2026 上,华为给出了针对 KV Cache 的专用存储方案:OceanStor M900 上下文内存存储(Context Memory Storage)。按华为的说法,它把单颗 NPU 可用的 KV Cache 容量从 GB 级推高到 TB 级,访问时延下降 90%。

打开网易新闻 查看精彩图片

华为同期发布的白皮书还算了一笔更直白的账:每投入 1 美元(约 7.15 元人民币)先进数据存储,可带来 10 美元(约 71.5 元人民币)的直接 GDP/产业价值、44 美元(约 315 元人民币)的产业衍生价值,以及 50 美元(约 358 元人民币)的社会价值——后者来自公共服务改善、灾害规避等社会收益。

KV Cache 为什么会撑不住

推理模型的上下文窗口正在快速膨胀,代理式 AI(Agentic AI)动辄几十轮的多轮对话更是雪上加霜,KV Cache——模型推理时的“工作记忆”——体积随之暴涨。华为的判断是:继续靠 GPU 显存加系统内存来存 KV Cache,在算力效率、成本和容量上都已经不可持续。

行业典型的推理存储分层是:L1(HBM)、L2(DRAM)、L3(本地 SSD)、L4(归档/共享存储)。做长序列推理时,L3 层容量不够、L4 层性能不足,高并发场景下 KV Cache 就会卡住。把全部 KV Cache 塞进 L1、L2 理论上最理想,但成本高到不现实。业内的共识因此转向:在昂贵的 GPU 显存与迟缓的传统网络存储之间,补一个 L3.5 层。

另一个被华为点出的问题是共享。超大规模数据中心里同时跑着数以千计甚至更多的计算任务,KV Cache 必须能在整个集群范围内共享,否则有些任务占着用不上的内存,同一份数据还会被反复加载、反复检索,造成效率与资源的双重浪费。

M900 做了什么

OceanStor M900 面向超大规模数据中心的 AI 推理,提供 PB 级容量、TB/s 级性能的全共享内存空间。它通过高速 UnifiedBus 互联网络实现全局池化与分层存储,把每颗 NPU 可用的 KV Cache 从 GB 提升到 TB,意味着更多上下文可以被复用、共享和留存,KV Cache 命中率显著提高。

架构上,华为称 M900 是业界首个把 CPU、网络控制单元与 NAND 控制单元集成在一起的设计。借由原生 KV 语义,SuperPoD 中的 NPU 到 SSD 实现“一跳直达”。华为给出的数据是:访问时延降低 90%,典型 AI 编程场景下推理集群的 token 吞吐翻倍,首 token 时延(TTFT)减半。

寿命方面,M900 采用 KV 感知的自适应存储技术,把 SSD 耐久度延长 16 倍,支持每天最多 24 次全盘写入(24 DWPD)。换盘需求随之减少,运维成本与长期的大规模 AI 推理基础设施成本都被压低。

“今天它们依然重要,但已经不够。”华为副董事长、轮值董事长 David Wang 表示,“AI 真正需要的是,存储持续把分散的数据变成高质量数据集,再变成知识与记忆,并在训练、推理和智能体运行时随时可被调用。换句话说,存储正在从过去的容量中心,走向 AI 时代的价值释放中心。”

IDC:卡在“数据就绪”上的企业

IDC 全球及 EMEA 研究高级副总裁 Thomas Meyer 在峰会上提供了更大的背景:相当多组织仍卡在 AI 转型的路上。相比美国和中国,西欧组织“从 AI 获取回报的成功率最低,预算超支也最严重”。与此同时,能够产出可衡量成果的概念验证(PoC)比例,已从 2024 年的 40% 上升到 2026 年的 52%。

Thomas 把“数据就绪度”称为被低估的挑战。他与 CIO 交流时听到的反馈是:“就 AI 而言,他们就是觉得自己没准备好数据——要么工具之间无法集成,要么拿不到实时数据,要么智能体在没有统一治理的情况下运行。”

他也呼应了华为关于上下文变长的判断:“如果 token 长度越来越长、越来越长,你就必须开始考虑外置存储加速,想清楚怎么维持推理质量。”白皮书的目标之一,正是推动 AI 产业停止“重算力、轻存力”,并就算存协同建立共识——企业需要的是融入整个 AI 生态的先进数据存储底座,而不是孤立的存储设备。