生产环境里的 AI 智能体,真正翻车的原因往往不是推理能力不够,而是管不住推理上下文里到底放了什么。一篇新论文把这个老问题重新定义了一遍:上下文管理不该被当成单纯的存储和检索,而是一个需要主动设计的生命周期。

五个原语覆盖完整记忆周期

打开网易新闻 查看精彩图片

论文智能体上下文管理拆成五个原语:架构设计、摄入、范围界定、预判、压缩与巩固。这五个环节串起来,决定了一件事——记住什么、怎么结构化、选哪种存储、带着来源地把信息巩固下来、提前预判未来需要什么,以及在 Token 预算内完成压缩。

作者的核心判断是:主动管理智能体“心里在想什么”,本质上是一个生命周期问题,而不是一个存储问题。这个视角把上下文管理从工程细节拉到了架构层面。

三种策略的成本曲线完全不同

论文从经济角度算了一笔账。朴素的上下文累积会让 Token 成本随着对话长度呈二次方增长,越聊越贵。粗糙的摘要虽然能把成本压成线性,但代价是准确率断崖式下跌。只有经过验证的压缩,才能在保持保真度的同时实现线性 Token 成本。

换句话说,简单截断和粗暴摘要都不算真正的解法。论文强调,只有经过验证的压缩——而不是简单截断或摘要——才能让 Token 成本随对话长度线性扩展,同时保住准确性。

参考实现拿下两个基准测试高分

论文还给出了一个参考实现 Maximem Synap,把这五个原语做成了多租户服务。在 LongMemEval 上,它拿到 92% 的得分;在 LoCoMo 上,得分是 93.2%。这两个数字被用来证明 ACM 框架不只是理论,而是具备实用可行性。

现有基准测试还缺四块拼图

论文最后把矛头指向了评测体系。当前基准测试漏掉了几个关键维度:延迟、Token 效率、上下文腐烂抵抗力,以及决策层面和组织层面的上下文。作者认为,这些缺口正是 ACM 这一类方法接下来需要补齐的前沿评测方向,包括跨用户的组织作用域层级。