过去几年,AI 基础设施的竞争主要围绕 GPU 和高带宽内存(HBM)展开。随着模型规模不断扩大,训练和推理需要越来越多的算力,GPU 集群、HBM 容量和互连带宽成为衡量系统能力的重要指标。
但进入长上下文、多轮对话和 AI 智能体时代,推理系统面对的问题开始发生变化。一次请求往往不仅涉及模型计算,还需要加载模型权重、读取历史上下文、检索知识、调用工具,再将结果返回模型继续推理。数据需要在 GPU、CPU、内存、存储和网络之间持续流动,只要其中任何一个环节无法及时供给数据,再强的 GPU 也只能等待。
因此,企业评估 AI 基础设施的方式也开始改变。客户真正购买的,并不是一块 GPU ,而是系统能够持续、稳定地完成推理并生成结果的能力。对于在线推理来说,真正被交付的产品,其实是 Token。
企业开始关注的不再只是拥有多少 GPU,而是相同硬件在单位时间内能够交付多少符合服务质量要求(SLO)的 Token,以及完成这些 Token 所需要付出的成本。
然而,一个 Token 的成本已经不仅由 GPU 决定,还受到 CPU、HBM、DRAM、SSD(固态硬盘)、网络、电力、散热以及软件和运维等整个推理系统的影响。与此同时,也不是所有 Token 都具有同样价值。只有满足首 Token 延迟(TTFT)、生成速度(TPOT)、响应质量和稳定性要求的 Token,才是真正能够交付给客户的有效 Token。
当评价标准从“买了多少 GPU”转向“交付了多少有效 Token”时,存储在推理系统中的角色也开始发生变化,其中最具代表性的便是 SSD。它正从传统的数据存储设备,逐渐成为 AI 推理基础设施的重要组成部分。
AI SSD,开始重写存储价值
相比内存,SSD 拥有更低的容量成本;相比远端对象存储,又离计算节点更近,可以保存那些暂时放不进内存、但很快还会再次使用的模型和上下文数据。
一方面,它能够承担更多模型权重、KV Cache、MoE 专家参数等运行数据,减少系统为了扩容而增加内存或 GPU 的压力;另一方面,又能够提前完成模型加载、复用已经计算过的内容,减少重复计算和等待时间,让同样数量的 GPU 在相同时间内完成更多推理请求。
这种思路已经出现在越来越多的推理系统中。例如,月之暗面(Moonshot AI)开源的 Mooncake,把 CPU、内存、本地 SSD 和高速网络组织成共享的 KV Cache 池,让不同 GPU 可以直接复用已经计算好的上下文,而不必重新计算。
还有 ServerlessLLM 将本地 SSD 纳入模型调度,在模型启动前提前完成加载,减少冷启动等待;TensorRT-LLM、vLLM 和 CachedAttention 等推理框架,则通过复用已经计算好的 KV Cache 或共享 Prefix,避免相同内容反复执行 Prefill。从某种意义上说,这些系统缓存的不只是数据,也是在保存已经付出过的计算结果。
当然,把 SSD 放进推理系统,并不意味着 Token 成本一定会下降。如果缓存没有命中,系统仍然需要重新读取甚至重新计算;预取策略不合理,还可能占用宝贵的 PCIe 带宽和内存空间。因此,评价 AI SSD 不能只看带宽、IOPS 等传统存储指标,更重要的是它是否能够缩短模型启动时间、提高缓存命中率、减少 GPU 等待,并最终让整个推理系统以更低成本交付更多满足服务要求的 Token。
消费级和企业级,AI SSD 是两种生意
不过,AI SSD 的价值并不会体现为一种统一的产品形态。不同的部署环境和客户群体,面临的瓶颈并不相同,对存储的需求自然也会有所差异。
从目前来看,AI SSD 很可能沿着两条市场路线发展:一条面向消费级市场,服务 AI PC、工作站等端侧设备;另一条面向企业级市场,服务边缘计算和云端 AI 推理基础设施。
对于消费级用户来说,最大的挑战是在有限的内存和功耗条件下,让设备运行更大的模型、保存更多本地知识,并在离线状态下继续使用 AI。消费级 AI SSD 最现实的形态,仍然是一块安装在 AI PC、工作站等设备中的固态硬盘。它依然承担系统盘和数据盘的功能,但会进一步加入面向 AI 的数据管理能力,让模型、缓存和用户数据能够更高效地保存在本地,而不需要改变现有 PC 的硬件架构。
苹果在《LLM in a Flash》中展示过一种思路:把大部分模型参数保存在 Flash 存储中,需要计算时再按需加载到内存。沿着这一思路,AI SSD 不仅可以存放大模型本身,还可以保存多个专业模型、个人知识库、AI 助手的长期记忆,以及暂时不用的数据,让系统根据不同任务动态组合所需内容,而不用一直占用宝贵的内存。
消费级 AI SSD 带来的首先是本地 AI 的可用性。会议记录、文档检索、代码生成、个人知识库等任务,不需要每次都重新从云端下载模型或上传数据,在网络较差甚至离线的情况下,仍然能够完成一部分工作,同时减少网络传输和云端推理成本。当然,数据保存在本地并不意味着天然安全,权限管理、数据加密和安全删除等机制仍然不可或缺。
企业级市场则完全是另一套逻辑。企业客户购买的不是一块 SSD,而是整个 AI 推理系统的效率。无论部署在企业边缘节点还是云端数据中心,更重要的问题都是如何减少 GPU 等待、提高 GPU 利用率,并持续降低每个 Token 的生成成本。
在企业边缘,AI SSD 可以帮助设备在弱网甚至离线环境下运行模型,支撑工厂、门店、医院等场景的本地 AI 应用;而在云端数据中心,它承担的角色则更加重要。本地 SSD 可以缓存模型和检查点(Checkpoint),减少反复从远端对象存储加载;机架或服务器集群中的共享 Flash 存储,则可以保存仍有复用价值的推理数据,让不同 GPU 在处理相似请求时直接利用已有结果,而不必重复计算。
这一思路也已经开始进入商业产品。英伟达推出的 CMX Context Memory Storage,就在 GPU 高带宽内存(HBM)、主机内存和共享存储之间增加了一层基于 Flash 的上下文存储,用来保存暂时放不下、但仍有复用价值的数据。它并不是让每一次推理都访问 SSD,而是尽量把这些数据保留在离 GPU 更近的位置,需要时能够快速取回,从而减少数据搬运带来的等待时间。
虽然都叫 AI SSD,但消费级和企业级产品解决的是两类完全不同的问题。消费级 AI SSD 关注的是本地 AI 能力,让设备能够运行更大的模型、保存更多个人知识,并提升离线体验;企业级 AI SSD 关注的则是整个推理系统的效率,通过减少模型加载和数据等待,提高 GPU 利用率,降低每个 Token 的生成成本。未来,这两条路线很可能长期并存,并分别沿着端侧设备和云端推理基础设施不断演进。
AI SSD,开始出现不同的产业路径
面对不同的应用场景,厂商们也开始沿着各自擅长的方向进入这一市场。有人希望提供完整的 AI 部署方案,有人从 SSD 控制器出发,让存储主动参与推理,也有人尝试同时打通计算和存储两侧,共同定义下一代 AI SSD。
群联(Phison)选择的是第一条路径。其 aiDAPTIV 将 SSD、中间件和部署工具组合在一起,通过分层管理模型权重,让超过显存容量的大模型也能够运行在消费级 GPU 上。相比单独销售一块 SSD,它交付的是一整套 AI 部署方案,客户不需要从裸设备重新搭建推理环境。最终,这类产品的竞争力仍然要落到可运行模型规模、启动时间、Token 吞吐、兼容性和整体部署成本等指标上。
江波龙则把重点放在 SSD 本身。其提出的 SPU+iSA 架构,希望把压缩、缓存、混合介质管理和智能预取等能力进一步放到存储侧,让 SSD 从被动响应 I/O,逐渐成为能够参与运行时数据管理的主动存储组件。进一步来看,这一思路也指向一种更加主动的 AI 存储节点:存储不仅负责保存数据,也开始参与模型、KV Cache 和专家参数等数据对象的组织、迁移与调度。当然,目前公开的数据主要来自厂商资料,不同方案之间仍缺乏统一的第三方评测,因此更适合作为一种产品方向来观察。
寅谱(Infplane)与联芸科技(Maxio Technology)的合作,则更强调计算和存储的协同设计。
联芸长期深耕 SSD 控制器、固件和闪存管理,并公开提出 AI 推理的价值尺度正逐渐从容量和价格,转向每 Token 成本和系统能效;寅谱则从 AI 芯片、Runtime 和操作系统切入,希望把模型运行过程中的调度信息更快传递到控制器和固件。
在之前提到的几种方案中,寅谱也是唯一从 AI 计算与系统软件出发的 AI Native 企业,其优势在于能够把模型和 Runtime 的需求直接映射到控制器、固件、NAND 管理以及 OEM 参考设计,让存储系统与推理框架形成更紧密的协同,而不仅仅停留在存储性能优化层面。
另一类产品则更接近传统企业级 SSD 的演进路线。英韧科技(InnoGrit)的洞庭 N3X、华为(Huawei)OceanDisk LC 560 等产品,主要围绕 AI 场景强化性能、容量密度、耐久性和服务质量(QoS),为模型加载、KV Cache、向量数据库和推理数据层提供更加稳定的存储基础。它们并没有改变 SSD 在系统中的基本角色,而是在现有架构下进一步提升企业级存储能力。
这些探索并不是彼此取代,而是分别覆盖 AI 推理系统的不同层次。有人负责把 AI 更容易部署起来,有人负责让存储更主动地参与推理,也有人继续夯实底层存储能力。随着 AI 推理规模持续扩大,这些能力很可能在同一套系统中融合,共同服务于一个目标:让相同的算力交付更多有效 Token。
从目前的发展来看,AI SSD 的价值正在不断延伸。最初,它帮助内存有限的设备运行更大的模型;随后,它开始保存模型缓存、上下文和其他可复用的数据,减少重复计算和数据搬运;未来,它还可能进一步成为端侧和云侧 AI 存储节点中的核心组成部分,在模型加载、上下文管理和推理调度中承担更加主动的角色。不过,无论产品形态如何变化,兼容现有硬件和软件生态,仍然是 AI SSD 大规模普及的重要前提。
它在端侧和云侧的发展重点也会有所不同。在端侧,AI SSD 的价值主要体现在支持更大的本地模型、更丰富的个人知识库、更好的离线体验,以及减少对云端推理的依赖;在云侧,它更关注模型冷启动、上下文复用、GPU 利用率以及每 Token 成本等推理基础设施指标。随着端、边、云协同不断成熟,未来计算任务也可能根据成本、时延、隐私和数据位置,在终端设备、边缘节点和云端之间动态分配。
从更长远的角度来看,AI SSD 争夺的并不仅仅是存储市场中的一个新品类,而是 AI 推理基础设施中的一个新角色。它既要以远低于内存的成本保存更大的智能工作集,又要比传统共享存储更高效地服务模型推理,把模型加载、上下文复用和弹性启动带来的效率提升,最终转化为更多有效 Token。
过去,人们评价一块 SSD,看的是容量、带宽和 IOPS;未来,衡量 AI SSD 的标准可能会变成另一组指标:它是否能够让相同数量的 GPU,在相同的时间和功耗下,交付更多满足服务要求的 Token。如果能够证明这一点,AI SSD 才有机会从一块“面向 AI 的高端硬盘”,真正成为下一代 AI 推理基础设施的重要组成部分。
1.https://developer.nvidia.com/blog/introducing-nvidia-bluefield-4-powered-inference-context-memory-storage-platform-for-the-next-frontier-of-ai/
2.https://developer.nvidia.com/blog/scaling-agentic-ai-factories-through-extreme-co-design-with-nvidia-bluefield/
3.https://www.usenix.org/conference/fast25/presentation/qin
4.https://kvcache-ai.github.io/Mooncake/design/ssd-offload.html
5.https://www.usenix.org/conference/osdi24/presentation/fu
6.https://www.usenix.org/conference/atc24/presentation/gao-bin-cost
7.https://machinelearning.apple.com/research/efficient-large-language
8.https://developer.nvidia.com/blog/5x-faster-time-to-first-token-with-nvidia-tensorrt-llm-kv-cache-early-reuse/
9.https://docs.vllm.ai/en/stable/design/prefix_caching/
10.https://phisonaidaptiv.com/zh-tw/how-aidaptiv-works/
11.https://cn.longsys.com/about/news/13353.html
12.https://www.maxio-tech.com/news/11645/13048.html
13.https://www.eeo.com.cn/2025/1222/774317.shtml
14.https://www.yingren.cn/news/%E4%BB%8En3x%E5%88%B0gen6%EF%BC%9A%E8%8B%B1%E9%9F%A7%E7%A7%91%E6%8A%80%E5%A6%82%E4%BD%95%E7%94%A8%E4%B8%89%E5%A4%A7%E8%A6%81%E7%B4%A0%E6%89%93%E9%80%A0%E5%9B%BD%E4%BA%A7ai-ssd/
15.https://e.huawei.com/en/documents/products/storage/97dc7a1dc98f4d3d90b268db03235cf7
运营/排版:何晨龙
注:封面/首图由 AI 辅助生成
热门跟贴