今年NVIDIA在定义下一代推理架构时,做了一件以前没做过的事:在GPU显存和通用共享存储之间,单独划出了一层编号为G3.5的专属空间,专门用来承载可复用的推理上下文。
这是存储第一次在AI计算的架构定义中拥有独立层级。
此前存储的定位非常明确——模型放在上面,用的时候加载,用完写回去,不参与推理过程本身。但现在NVIDIA将这一层交给了BlueField-4和NVMe闪存,配套了专门的编排、元数据管理和数据通路,构成了完整的CMX平台。当一个基础设施巨头开始为存储定义独立的架构层级,意味着存储在AI推理中的角色已经发生了根本性转变。
而这一变化,本质上是由日趋复杂的Agent负载催生的。
02 GPU在等数据,而等待意味着高昂成本
传统大模型服务节奏简单:一次请求,一次推理,一次输出。数据依赖轻,存储只在任务首尾出现。
Agent完全是另一回事。一次任务可能跨越数十次模型调用和多个计算节点,中间伴随持续的规划、检索、工具调用、验证和状态存储。每一步的输出都决定着下一步需要读什么——KV Cache、向量索引、MoE专家权重、用户记忆,被反复、交替、动态地访问。系统能否持续产出有效Token,越来越取决于这些数据能否按时到达GPU。
单卡价格持续攀升,任何因数据未就绪导致的计算中断,都意味着实打实的算力浪费。
这里面还隐藏着一个结构性矛盾。模型权重和大段KV缓存是可预测的大块顺序读取,渴求高吞吐;向量查询、图遍历和稀疏专家命中是海量极小的随机访问,要求高并发与低延迟。两种截然不同的模式在同一个任务里交替出现,只顾好一头,另一头必然成为瓶颈。
所以问题已经不是要不要给推理配更好的存储,而是整条数据路径都需要重新设计。
03 从内存到闪存,推理数据路径正在分层成型
行业已经在这条路径上角逐,并逐步形成清晰的层级与分工。
先看内存层。CXL通过缓存一致性和内存语义将外部内存接入处理器地址空间,打破物理内存边界。长上下文KV、Adapter池、检索缓存——这些仍处于活跃期但无法全部塞进HBM的温数据,有了可池化的去处,内存资源得以跟随任务动态分配与回收。
再看上下文层。CMX是这条路径上第一个明确围绕推理上下文设计的层级。它用NVMe闪存在多个GPU节点间建立共享的上下文池,让耗费计算代价生成的KV Cache不必每次重算。存储投入的回报,可以直接用重算减少量、GPU利用率提升和每Token成本降幅来衡量。
然后是传输层。cuFile与SCADA构成一组互补的双粒度接口——cuFile通过GPUDirect Storage建立绕开CPU的存储直通路径,负责模型权重和较大KV段的大块搬运;SCADA则让GPU线程直接发起并控制存储操作,使CPU同时退出控制路径和数据路径,针对Agent场景中低于4KB的海量并行访问做了专门优化。
然而,所有这些架构与协议层面的进展,最终都要落到SSD这个物理设备上。如果垃圾回收时P99延迟剧烈波动,上层预取策略精心对齐的计算窗口就会直接失效。
这恰恰是当前行业产生分歧的最后一公里。
04 AI SSD的真正分歧:谁来定义数据行为
如今当行业探讨AI SSD时,各方语境往往大相径庭。真正的分歧早已脱离容量或带宽的内卷,而是聚焦于一个更底层的问题:SSD的数据行为何时触发预取、如何划分冷热、数据在闪存颗粒上如何物理摆放,究竟该由谁主导?
一条清晰的分水岭正在显现。存储厂商努力向上理解计算逻辑,计算团队则跨界向下定义存储行为。
在向上理解的阵营中,群联与江波龙给出了不同深度的解法。群联选择在设备之上架设一层专属中间件,将SSD整体转化为GPU显存之外的高容量缓存。这种解法保持了清晰的产品边界,让客户无需从零搭建数据管道。江波龙走得更深,直接将智能化逻辑下沉至主控固件层——SPU负责存储控制、缓存、压缩和数据搬运,iSA感知推理负载并制定冷热分层与预取策略,让SSD在可控边界内具备主动理解访问模式的能力,而不只是等待主机提交孤立I/O。
寅谱与联芸的合作展示了向下定义的另一种可能。
寅谱从推理芯片、近存计算和计算机平台进入AI SSD,联芸拥有覆盖SSD主控、NAND适配和模组量产的产业基础。双方把计算侧对模型执行序列的理解,同存储侧的主控、固件和介质管理连接起来,围绕KV Cache、MoE专家和不同精度数据进行切分、冷热管理与预测式预取。目标很明确:让数据布局和设备行为贴近模型的实际执行顺序。其中部分技术栈来自寅谱推理芯片研发中形成的数据流和缓存调度能力,联芸则负责把这些要求落实到可量产的硬件和固件体系。
三条路线各有适用场景。但如果推理的真正瓶颈在于数据行为能否契合模型的执行节奏,那么由计算侧理解语义、存储侧完成确定性执行的组合,可能比单纯从某一端向另一端延伸更容易形成新的产品思路。最终哪种模式跑通,取决于谁能把技术收益真正转化为更高的设备利用率和更低的Token成本。
05 从单盘参数走向节点形态与数据治理
无论数据行为由谁定义,AI SSD的产品形态本身也在变化。
CMX已经表明,未来部分SSD不再以单盘面貌出现,而是以存储节点的形式参与推理集群。一个节点可以维护跨多个GPU共享的KV目录与Prefix缓存,承载Adapter和模型镜像,并在靠近介质的位置执行预取、压缩、加密和租户隔离。Mooncake的实践已经说明,将CPU、DRAM、SSD和网络组织为统一控制面下的分布式缓存池,能把原本孤立的存储资源转化为可调度的数据层。客户的采购视角也随之迁移——从单盘容量与带宽,扩展到有效上下文容量、缓存命中率、跨节点共享能力和数据治理成本。
与此同时,Agent持续产生的模型上下文、工具调用轨迹、记忆对象和证据链,让存储侧的治理需求急剧膨胀。KV块需要标记所属模型与租户,记忆对象需要版本、TTL和安全删除,每一次I/O都可能涉及权限校验与身份绑定。这些需求超出了传统块设备的能力边界。设备不必理解完整模型,但需要按照上层给出的语义执行放置、回收和生命周期管理。功能越接近Agent,越需要明确的语义边界和可审计的执行机制。
这也意味着,未来存储产品的竞争力不只体现在硬件规格上,还会延伸到控制面软件、Runtime适配和长期SLA承诺。
06 编号只是入场券
存储拿到了G3.5这个层级编号,正式进入AI推理的核心架构图。但这仅仅是一张入场券。
上一轮竞争中,存储厂商比拼的是介质工艺和主控设计——颗粒密度更高、主控速度更快、固件更稳定,就能占据更大市场。这些硬核能力不会过时,但正逐渐从胜负手降维成基本功。
在Agent推理场景下,客户评估存储的维度已经改变。有效上下文容量、缓存命中率、GPU利用率、P99延迟的稳定性、每Token成本和每瓦Token产出——这些指标衡量的不再是存储硬件的绝对物理性能,而是它对系统有效Token产出的实际贡献。
训练数据吞吐、模型文件存放这些场景中,传统大容量通用存储的价值不会消亡。但在Agent推理这条全新的数据路径上,竞争标尺正在从每TB成本转向每Token成本。
对存储厂商而言,下一层核心壁垒,或许不仅在于介质与主控的物理突破,更在于对模型究竟如何运行的深刻理解。
热门跟贴