中科曙光在数博会发布的 ParaCache 存算协同方案,堪称今年国产存储领域的重要突破。
打开网易新闻 查看精彩图片
传统模式下,GPU 显存资源紧张,缓存溢出时需重复计算历史内容,导致算力浪费。
ParaCache 将 GPU HBM、CPU 内存、本地 SSD 和分布式共享存储整合为四级缓存池,按数据热度分配存储位置:热数据留显存、温数据存内存、冷数据放 SSD 和分布式存储,实现 KV 缓存的长效留存与复用。
打开网易新闻 查看精彩图片
这就像为整个集群建立共享记忆库,替代过去每个 GPU 各自的小本本,大幅减少重复计算。
原本被重复计算拖累的 GPU 资源,如今可处理更多请求,大幅提高 token 产出效率,尤其适合智能客服、知识库、代码助手等需要共享大量背景资料的业务场景。
打开网易新闻 查看精彩图片
ParaCache 原生兼容主流 LMCatch 技术栈,无需对现有推理系统大规模改造,平滑落地特性降低企业迁移成本。
中科曙光在存储领域积累深厚,此前 ParaStor 存储系统刚包揽 IO500 全球生产型全节点和 10 节点两项第一,此次 ParaCache 将存储能力延伸至推理链路,使存储从传统数据仓库转变为 token 生产加速器。
打开网易新闻 查看精彩图片
AI 基础设施建设正逐步摆脱单纯数卡的思维模式,转向关注 token 生产效率。ParaCache 的出现,为解决大模型推理中的存储瓶颈提供新思路,标志着国产存储技术在智源时代的重要进展。
打开网易新闻 查看精彩图片
热门跟贴