截至今年3月,中国日均Token调用量已突破140万亿。这个数字来自GMIF2026全球存储器行业创新峰会现场。三星电子副总裁、Memory事业部首席技术官Kevin Yoon做了一个换算:中国每天消耗的Token,是中国国家图书馆全部藏书对应Token量的20倍以上,也接近人类历史上所有出版图书总量的6倍。
这是今年第五届GMIF2026释放的第一个明显信号。摩根士丹利执行董事、大中华区半导体分析师颜志天指出,在未计入HBM的情况下,2026年存储占全球云数据中心资本支出的比例接近五成,2027年预计进一步升至53%。
热钱涌向存储,背后是前所未有的推理需求增加。面对140万亿量级的推理负载,存储要应对的不只是数据量的增长,还有不同数据在访问频率和生命周期上的巨大差异。不同存储介质需要为此补齐各自在容量、带宽、时延和耐久性上的短板。
三重压力同时压向存储
当AI从训练端的模型竞赛走向推理侧的规模化应用,存储面对的压力变得更具体。Solidigm亚太区销售副总裁倪锦峰将其概括为三个维度。
最直观的是数据丰富度。星河智联现场展示的车载Agent可以说明这一点:除了理解语音、视觉、车辆信号等不同形式的信息,Agent还要结合对话历史、长期记忆、用户画像以及实时变化的车身状态完成判断。不同数据的来源、形态和更新频率各不相同,直接导向第二层压力——推理复杂度。
Arm全球存储业务负责人John Xavier Lionel对推理数据做了拆解:模型变大,会带来更多权重和运行时状态;上下文越长,需要为后续Token生成保留的KV Cache也在增加;同时服务的用户越多,系统还要为每个请求分别保留KV Cache;进入逐Token生成的Decode阶段,模型权重和KV Cache还会被反复访问。
当推理模式从一次性问答转向持续运行的Agent,单个任务持续时间被拉长,需要长期维护的上下文和运行状态不断累积,这引出了第三个维度——运营持久性。Dify联合创始人陈璐莎判断,未来企业运行的Agent数量可能从个位数上升至数百个,并且能够24小时待命、执行长程任务和承担高并发请求。
这种持续运行也对应不同的企业AI服务模式。并行科技提供的MaaS模式允许企业通过API持续调用不同模型并按Token付费,服务商需要持续保障模型调用的首Token时延、成功率和吞吐量,并监控调用费用。针对企业本地Token工厂的建设规划,联想更关注算力资源的实际利用率、服务运行的稳定性,以及最终能以多低的成本持续产出Token。
SSD、HDD和NAND开始越界
数据、推理和运营三种因素叠加,存储容量扩张、带宽提升、时延降低、耐久性保障等多重挑战随之袭来。变化最明显的当数过去更多负责大容量和持久化存储的SSD,多家企业已经从多个维度展开升级。
不同任务正向同一款SSD提出不同的性能要求。以Agent的工作环节为例,规划阶段强调低时延、检索阶段要求高吞吐,执行阶段则更指向高带宽。慧荣科技通过主机软件和存储软件栈识别任务类型,再由SSD控制器按QoS等级调整资源配置,使同一块SSD能够响应不同AI负载。
SSD不只是在内部做差异化分配。闪迪资深产品市场总监张丹将SSD拆成三类:直接连接GPU的SSD主要承接热KV等高频访问数据,为计算持续备料;通过网络连接GPU的SSD仍然服务计算,但部署规模可以更大;位于计算集群之外的存储型SSD则更强调容量,主要承载不需要被频繁访问的数据。
SSD向上承接更多靠近计算的数据之外,也在向存储金字塔的下层延伸。据倪锦峰观察,为了减少机房空间占用和功耗开销,北美大型互联网公司已经开始用大容量QLC SSD替代部分HDD。
这并不意味着HDD的影响力式微。定位于传统HDD与企业级SSD之间,大数极限设计的PMD试图在传统机械硬盘基础上通过多路并行、扩大I/O请求队列,并结合请求聚合、预取和缓存等方式提高存储带宽和随机访问能力。
工作负载的变化也影响了SSD的测试环节。传统SSD测试常以固定4K、128K数据块进行读写,而AI负载会出现突发、高并发等更加复杂的I/O行为。欧康诺因此在AI SSD测试中加入深度学习I/O负载,以及KV Cache、断点恢复等场景。
构成SSD底层介质的NAND,本身也在沿着不同方向突破原有的能力边界。一种思路是直接提高NAND器件本身的性能。在意识到端侧推理向DRAM施加的成本压力后,三星设计的Z-NAND,其核心Die基于SLC,并集成TSV等技术提高读取性能。在Kevin展示的架构中,操作系统和KV Cache仍留在DRAM,大容量、读取密集的模型权重则被放入Z-NAND。
另一种思路则将NAND升级成为HBF。据北京大学集成电路学院院长蔡一茂介绍,目前主要有两条技术路径:一条从NAND阵列本身入手,通过缩小阵列尺寸降低读取时延;另一条则借鉴HBM提高并行度的思路,通过增加接口数量来提升带宽。他同时指出,尽管两种方案都在试图补足传统NAND读取速度和带宽的短板,但仍需要解决如缩小阵列会牺牲部分存储密度、NAND的读取时延仍然偏高、有限的写入寿命难以承受KV Cache等数据的频繁更新等问题。
更加激进的NAND变化体现在从存储继续向计算延伸。蔡一茂提到,当前北大和燕芯微等合作伙伴正在探索利用NAND阵列直接完成部分存内计算,减少数据在存储和计算单元之间的往返。
数据分层从兜底走向主动调度
传统存储层级建立在速度、容量与成本的权衡之上:越靠近计算单元,速度越快、容量越小、单位成本越高;越向下则相反。这套分工能够长期保持稳定,也与不同数据相对固定的访问需求有关。
如今,软硬件都在发生变化。一边是存储载体自身的能力边界不断外扩:从存储金字塔层级出发,SSD同时向计算侧存储和大容量存储侧延伸,更靠近塔底部的HDD试图向更高性能靠拢;聚焦具体存储介质,NAND进一步向高带宽乃至计算能力拓展。另一边,AI带来更多类型的数据,同一份数据的访问频率和生命周期也会随着计算过程不断变化。原本相对稳定的数据与介质对应关系由此开始松动。
在多位与会嘉宾看来,数据跨层移动本身并不是AI时代的新现象,真正的变化在于,数据管理正从“HBM不够给DRAM、DRAM不够给SSD”的兜底式分层,转化为系统设计之初的主动分层和运行过程中的动态调度。
芯展速副总裁李蓁用三个关键词拆解了当前AI数据供给体系:存储决定什么数据由什么介质承载,连接负责数据稳定、高效地流动,解决方案则通过软件完成调度和应用适配。
联芸与寅谱联合推出的AI SSD方案则将这种分工落到了推理运行过程中。针对MoE模型参数,当前需要调用的专家权重留在CPU内存和GPU显存中,暂时不会被调用的权重则放入SSD。考虑到SSD访问速度更慢,系统还会预测下一阶段可能调用的专家,提前将相应模型和参数预取回来。针对KV Cache,高频访问的留在内存,低频部分则下沉到SSD。
把范围从单个计算节点放大到整个算力集群,杰创智能搭建的常青云平台进一步打通“数据—存储—计算”的链路,提前把任务所需的数据准备到相应节点,并结合任务类型、GPU代际和网络带宽等信息,将数据与合适的算力资源匹配起来。
这也呼应了佰维存储董事长孙成思在现场的判断——“数据供给的效率决定算力的产出”。当AI推理走向规模化、高并发和持续运行,存储最终要回答的,已经不只是数据放在哪里,还有如何让数据及时抵达算力。
热门跟贴