AI 应用对数据的吞吐越来越“贪婪”,一场存储链路的变革正在发生。2026 年 8 月 4 日,英伟达在“未来内存与存储”大会上宣布,正式开源其 cuFile 垂直数据存储栈的应用程序编程接口(API),将 GPU 直接访问高速存储的延迟压到了毫秒级别。同一场合,英伟达还发起了一项名为 Storage-Next 的行业倡议,拉拢 40 家存储与闪存头部企业,共同推动面向 GPU 驱动的下一代存储方案。

cuFile 并非凭空出世。它早在 2021 年 7 月就随 CUDA 工具包 11.4 正式发布,作为 GPUDirect Storage 软件的核心组件,承担起本地分布式存储与 GPU 显存之间的高速直连通道。在此之前,数据要从 SSD 进 GPU,必须经过 CPU 和系统主内存的中转,每一步都是时延和带宽的折损。cuFile 的意义在于砍掉“中间商”——借助直接内存访问(Direct Memory Access,DMA)机制,数据可以从 NVMe 固态硬盘等存储设备直接推送到 GPU 显存,绕过 CPU 和主内存的路径,极大缩短了数据就位的时间。

打开网易新闻 查看精彩图片

这种直连架构,直接击中了大规模 AI 训练和推理的痛点:GPU 饥饿(GPU starvation)循环。在分布式 GPU 阵列中,当某个或某几个 GPU 因数据喂不饱而闲置等待时,整组芯片的利用率就会被拖垮。cuFile 提供的低延迟、高带宽数据高速公路,让 GPU 能够近乎实时地刷新显存,从而持续高速运转。英伟达在发布会上强调,cuFile API 能够实现从存储到 GPU 的安全毫秒级访问。这里的“毫秒级”意味着,哪怕面对检索增强生成(RAG)或具备行动能力的 AI 智能体(agentic AI)所需的巨型数据集,也能以令人咋舌的速度完成数据同步。

开源这一动作,相当于把这条“高速公路”的图纸交给了产业界。从此,存储厂商、控制器厂商、散热设计、机架编排等各环节都能围绕 cuFile 原生构建方案,而无需在封闭黑盒里摸索。英伟达同步推出的 Storage-Next 倡议正是为此配套:DataDirect Networks、铠侠、美光等 40 家知名的存储与闪存供应商,将共同投身于新一代 AI 存储技术的研发。他们将在 SCADA——也就是“规模化加速数据访问”(Scaled Accelerated Data Access)——的框架下,为大规模并行 GPU 提供极高的带宽和极低的延迟保障。这套 SCADA 解决方案,既支撑同时调用海量数据的现代 AI 训练,也适配那些以“思考”速度快速抓取数据的超大混合专家模型(mixture-of-experts)推理场景。

将 cuFile 开源,等于把英伟达在 GPU 直连存储领域打磨多年的能力推向公共赛道。这既降低了 GPU 与高速存储之间“最后一厘米”的接入门槛,也可能重新划定了 AI 基础设施优化的起跑线。当数据通路不再被 CPU 钳制,当毫秒级延迟成为标配,下一波让 GPU“吃饱”的工程竞赛,或许才刚刚开始。