存储要闻

打开网易新闻 查看精彩图片

AI不仅改变着我们的生活,更是在改变着科技行业。

全球存储观察分析指出,当前,AI推理正在重写存储行业发展格局,而在这场以KVCache为中心的变革中,中国存储厂商的身影也越来越多了。在刚刚落幕的美国圣克拉拉举办FMS 2026上,再次为业界发出一个强烈信号,闪存不再是那个躲在磁盘背后的配角,正被推上AI推理主舞台的主角,可以与HBM和DRAM平起平坐。

全球存储观察评论

1987年,吉姆·格雷用存储五分钟准则划定DRAM与磁盘的边界,此后的多次修订阈值始终维持在分钟级别。

但是,在AI时代,当NVIDIA的GPU与新一代高性能SSD结合,DRAM与闪存之间的缓存阈值从几分钟缩减到秒级。

此时的NAND闪存从此告别被动存储,而成为GPU可以直读直写的主动内存扩展层。

这一切的根源,在于

KV Cache。

正是大模型推理中

让所有架构师头疼的KV Cache。

随着上下文窗口动辄百万Token,

智能体应用持续爆发,

KV Cache的体量与昂贵的HBM容量,

形成了前所未有的挑战。

AI推理鲸吞HBM,解决这个挑战的办法只能将KV Cache从GPU的金库搬出来,部署到共享NVMe闪存中读取。

这就催生了NVIDIA CMX所定义的上下文内存全新存储层,一块由闪存构成的高速共享缓存池。

NVIDIA CMX平台建立了一个新的G3.5层,即专门针对KV缓存进行优化的以太网连接闪存层。

CMX加快了KV缓存数据访问和Pod内节点之间的高速共享,以增强性能并优化功耗,以满足不断增长的大上下文推理需求。

在2026年8月3日,铠侠发布的企业级CM10系列PCIe 6.0 SSD,宣布支持NVIDIA 的CMX架构,通过CMX架构,SSD可将内存层级扩展至GPU显存之外,使得企业级SSD成为AI基础设施中的关键配件。

Marvell通过CXL交换机将单机柜可池化内存容量推至48TB,推理吞吐量提升4.8倍,首Token延迟缩减82.7%。;CXL交换机通过提供具有亚微秒级访问延迟的近本地共享内存池,消除了多跳数据移动,实现更高的GPU利用率。

与此同时,以色列理工学院提出的AnchorKV技术以20倍压缩率压缩KV Cache且不丢弃任何Token。

无问芯穹的跨集群PDD架构通过前缀缓存将带宽需求降低10倍。

KARAT方案聚焦典型的近存计算实践。KV Cache和索引键存放在大容量LPDDR中,紧邻的PNM节点负责执行所有读取KV Cache的Attention操作,GPU节点只负责模型权重和投影/MoE层。最终结果是,Attention检索在存储侧就地完成,GPU只接收处理好的结果,两者各司其职,SLO约束下吞吐量较传统GPU-only基线提升2到6倍。

值得注意的是,FMS 2026上三星展示的CXL Processing Near Memory for RAG加速,以及AMMA以HBM-PNM替换GPU计算die的方案,都与KARAT方案同属近存计算阵营。

这意味着计算随数据走已从学术概念走向芯片与系统厂商共同押注的明确方向。当池化内存自带算力,Scale-up总线上的KV流量压力将大幅缓解,整个数据中心的内存架构将因此重写。

显而易见,围绕KV Cache落户闪存这一新场景,从闪存原厂到主控设计,从CXL互连到系统方案,全球存储产业链已逐步完成完成了从介质、主控到系统的完整闭环布局。

在这个全球存储产业重构的关键窗口,中国存储厂商在FMS 2026上也有表现。

江波龙携手AMD联合调优,推出AIDIMM加iSA存储智能体加AI SSD的成套一体化方案,现场实机演示仅凭64GB AIDIMM内存规格即可流畅运行122B中大型主流大模型。

在CXL战场,澜起科技试产新一代CXL 3.2内存扩展控制器,基于PCIe 6.x协议、单通道速率达64 GT/s,已导入三星和SK海力士的下一代产品,以全球首发姿态抢占了控制器芯片的卡位先机。

慧荣科技展示面向AI工厂和边缘AI的全场景存储方案,其MonTitan平台专为KV Cache卸载打造。

得一微电子呈现基于存储控制、存算互联、存算一体三大支柱的全场景AI存力产品矩阵。

在存储主控芯片这一关键环节,虽然中国已经完成了技术储备,但是,长鑫存储在HBM领域与国际巨头差距依然明显,海外设备获取难度增加也给产能扩张带来不确定性。

当KV Cache成为AI推理的血液,闪存就是承载血液的血管。这场变革的终局,不是闪存取代内存,而是内存与存储的边界被彻底抹平,整个数据中心围绕Token产出最大化这一目标在不断进化。

中国厂商已经坐上了牌桌,但能否拿到最终的赢家筹码,取决于能否在从芯片到系统的每一个环节完成从追赶到引领的跨越。

可能,有人会有疑问,为什么华为存储、曙光存储、浪潮存储、新华三存储、宏杉科技、同有科技等存储系统与整机厂商未参与FMS2026大会?

国产存储系统与整机厂商集体缺席美国FMS 2026,并非偶然,其背后是FMS的独特定位带来的结果。

美国FMS(闪存峰会)起源于NAND闪存技术论坛,至今大会聚焦核心仍是存储芯片、介质和主控。参会主角是三星、SK海力士、美光、铠侠、闪迪等原厂,以及慧荣、Marvell等主控厂商。不仅国产存储系统整机厂商不热心FMS,国外存储系统整机厂商也如此。

再者,深耕国内,无需出海镀金,中国存储系统厂商的市场重心几乎全部在中国大陆。

华为于2026年3月在深圳举办华为中国合作伙伴大会·数据存储峰会。

新华三于2026年5月在北京主办NAVIGATE 2026领航者峰会,发布AI原生存储等七大新品。

浪潮于2026年7月在北京发布自研浪潮数据AI数据操作系统。

中科曙光则选择在ISC 2026高性能计算大会上展示其全闪存储系统,并夺得IO500榜单双榜第一。

此外,如宏杉科技参加了国内的AI存储产业大会、丝绸之路网络安全论坛和医疗信息技术展会。同有科技则在空天信息大会和国产存储合作伙伴共创会上亮相。

可见,这仅为中国存储系统厂商战略选择而已。

【存储小百科】

存储五分钟准则是什么?

吉姆·格雷(Jim Gray)提出的“五分钟准则”(Five-Minute Rule),是一个用来衡量数据该放在昂贵但快速的内存里,还是便宜但慢速的磁盘上的成本效益决策法则。它的核心判断标准可以概括为一句话:如果一个数据页在5分钟内被访问的次数超过一次,那把它放在内存里就更划算;反之,放在磁盘上更省钱。

这个5分钟的临界点,完全是基于1987年的硬件价格算出来的一笔经济账:

· 内存的成本:当时1KB的内存价格约5美元。

· 磁盘的成本:当时每秒钟能完成一次磁盘访问的硬件成本约为2000美元。

有了这两个价格,吉姆·格雷的思路是:如果某条1KB的数据每隔400秒(约5分钟)才被访问一次,那么为了保存它所花的内存钱,就跟每次去磁盘读取它所花的磁盘钱 差不多。访问间隔更短,放内存划算;间隔更长,放磁盘划算。

5分钟只是一个约数,具体数值会根据数据块大小变化:数据块越大,访问代价高,临界点越短(如4KB数据约2分钟);数据块越小,临界点越长(如100字节数据约1小时)。

为何今天仍在谈论它?虽然30多年来内存和磁盘的价格已天翻地覆,但五分钟准则通过经济模型思考存储层级的方法论依然有效。在如今AI大模型动辄百万Token的背景下,KV Cache该放在昂贵的HBM还是便宜的SSD上,本质仍是五分钟准则的现代版拷问。2019年的研究就指出,对于DRAM和HDD,临界点已从5分钟变成了4小时。而到了AI时代,DRAM与高性能SSD的临界点更是从分钟级缩短至秒级。

什么是近存计算?

近存计算,简单说就是让计算单元主动搬到数据存放的地方去干活,而不是把海量数据长途搬运到CPU或GPU身边再处理。

要理解它为什么重要,得先看清传统架构的内存墙困境。在经典冯·诺依曼体系里,CPU/GPU是运算核心,内存是数据仓库,两者分离。每次计算,数据都得从内存经过总线搬运到处理器。这个搬运过程消耗的时间是计算的成百上千倍,功耗也极大。到了AI大模型时代,KV Cache动辄几百GB甚至TB级,如果每次做Attention计算都要把整个KV Cache从存储介质搬回GPU,总线带宽会被瞬间占满,延迟急剧飙升,这就是著名的数据搬运墙或冯·诺依曼瓶颈。

近存计算的解题思路极其直给,不搬数据,搬计算。它通过在存储芯片(DRAM、HBM或NAND闪存)旁边或内部部署专用的计算单元(如ALU、SIMD核心或定制加速器),让这些计算单元直接在数据家门口完成读取和运算,只把最终极少量结果返回给主处理器。这样一来,庞大数据体的往返迁移被彻底消除,带宽压力和功耗都指数级下降。

近存计算(PNM)与内存计算(PIM)常常被一并讨论,但两者有细微差别:

内存计算(PIM,Processing-In-Memory):计算单元直接嵌入内存颗粒的内部电路,紧贴存储单元,集成度极高,但计算能力相对受限,适合单一重复的简单操作。

近存计算(PNM,Processing-Near-Memory):计算单元放在存储芯片的旁边(比如同一个封装内或紧邻的芯片上),计算能力更强、更灵活,能承载更复杂的逻辑,适合KARAT方案中面对不断演进的稀疏注意力算法。

【声明】本文和作者回复仅代表个人观点,不构成任何投资建议。