智能体记忆一直有个尴尬:上下文越长,KV 状态越臃肿,推理越慢。KVMEM 给出的思路是——把旧的 KV 状态分页存起来,而不是全部塞在显存里硬扛。

效果直接体现在数字上。在 DeepSWE 上跑 Qwen3.8-27B,Pass@1 从 43.8% 提升到 48.4%。这个成绩优于只用压缩的方案,说明分页旧状态比单纯压缩更管用。

打开网易新闻 查看精彩图片

恢复速度才是关键差异

更值得注意的是恢复速度。在受控基准上,KVMEM 比 Compact+RAG 快 11.4 到 53.8 倍。对于需要反复调取历史记忆的智能体来说,这个差距决定了它能不能在百万 token 级别真正跑起来。

分页这个动作本身不新鲜,难的是在 KV 状态上做对——既要保住精度,又要让旧状态随时可召回。KVMEM 把这两件事同时压进了同一套机制里。