原标题:国产算力从单点性能走向系统协同:星流计算 NovuWing 跑通多 Agent 新架构
2026年8月7日,企业级全栈 AI 基础设施公司星流计算(NovuInfra)正式发布《Agent Native Compute:面向企业 Agent 时代的新一代 AI 计算基础设施》白皮书,系统披露 NovuWing™ 技术架构。目前,ShareKV 双组件已跑通:KV Cache 命中率超80%,中位 TTFT 降至基线20% 以下。
它关注的不是如何再提升一次模型推理的峰值性能,而是一个更现实的问题:当企业同时运行几十个、上百个 Agent,如何让它们长期保持上下文、频繁唤醒与协同,又不让 GPU、HBM 和整体成本失控?
从“计算墙”走向“内存墙”
Agent 在 Active、Idle、Deep-Idle 和 Recovering 等状态之间不断切换,并持续保存上下文、KV Cache 与可恢复运行状态。若这些数据长期驻留 HBM,昂贵的高带宽资源会被低活跃状态占用;若直接释放,Agent 再次唤醒时又要重新计算。为此,NovuWing™ 构建三级智能内存:L0 HBM 承载活跃 KV Cache;L1 DDR 保存短期闲置、可能快速复用的状态;L1.5 CXL.mem / NVMe 承载低活跃 KV Cache、上下文快照与暂停 Agent 状态。数据随生命周期分层流动,Agent 激活时再按需预取和恢复。
关键不只是分层,而是理解 Agent
传统缓存调度通常依据访问热度或显存压力。NovuWing™ 进一步引入 Agent 语义:系统判断数据属于哪个 Agent 与 Session、当前处于什么状态,以及迁移、加载或重算的恢复成本。Agent Runtime 通过 agent-id、session-id 与 tier hint 把策略传递给推理框架和内存体系,使缓存管理从“显存不够再换出”转向“依据 Agent 状态主动迁移与预取”。
为把这套机制落到工程系统,星流计算自主开发 ShareKVConnector 与 ShareKVSidecar。前者运行在 vLLM 推理实例侧,衔接 GPU/HBM 与 L1+L1.5共享内存,并执行 KV Cache 迁移、预取与恢复;后者作为宿主机共享服务,统一管理 DDR 共享内存池与 CXL.mem(或 NVMe)池,为多个推理实例提供共享 KV 服务。两者通过共享内存和异步 I/O 建立 HBM、DDR、CXL.mem(或NVMe)之间的数据通路,减少额外拷贝与迁移开销。
阶段性基线结果进一步验证了这条技术路径:在当前企业 Agent 场景测试中,KV Cache 命中率超过80%,中位首 Token 时延(TTFT)降至基线的20% 以下。前者减少了可复用上下文的重复计算,后者直接缩短首 Token 等待时间,表明 Agent 语义调度与 ShareKV 分层机制已开始转化为可感知的效率收益。
从白皮书到产品:关键链路跑通,效率收益开始显现
目前,相关能力已在玄矩™ A1与 SerpMind™ 产品体系中完成贯通。玄矩 A1提供计算与三级内存底座,Agent Runtime 负责生命周期和资源调度,SerpMind Enterprise Agent OS 提供 Agent 的创建、运行与治理。围绕核心机制,星流计算已提交发明专利申请《基于 Agent 语义的三级分层 KV 缓存智能调度方法及系统》,申请号:202611065591.X。
让算力从“可用”走向“经济可用”
星流计算将这一逻辑称为算力经济学:企业不应只比较峰值 FLOPS 和采购价格,还要考察 Agent Throughput、KV Cache 效率、Cost per Agent、Cost per Task 与 TCO。把带宽留给 HBM、把容量放到更合适的层级,再由 Agent 语义决定数据何时流动,本质上是让每一份昂贵算力投入承载更多有效智能。
对国产算力而言,这意味着创新正从芯片、板卡和服务器的单点性能,扩展到 CPU、GPU、内存、推理框架与 Runtime 的系统级协同。只有“算得起、跑得久、管得住”,多 Agent 才能真正进入企业生产。上述两项数据为当前企业 Agent 场景的阶段性基线结果;完整模型、上下文长度、并发规模、硬件配置及标准化 Benchmark 与 TCO 数据,将在完成可重复验证后独立发布。
热门跟贴