AutoHarness、AutoContext,现在又来了个AutoCompact。一条越来越清晰的线索是:把原本由外部框架做的事,训练进模型本身。这次被交出去的权力,是"什么时候压缩上下文"。

AutoCompact 的核心思路很直接——让智能体自己决定何时压缩、保留哪些工作状态、以及压缩后如何接着干。这套机制和 Meta 那篇训练模型原生管理上下文的论文思路相近,但落点更具体:压缩这个动作,从框架的固定规则变成了模型的一项可学习能力。

打开网易新闻 查看精彩图片

先纠错,再训练

训练流程分两步走。第一步,由一个评判者先审查基础智能体的压缩决策,在它真正执行之前,把有问题的决策替换掉。这些被修正过的轨迹,用来做监督微调。

第二步是强化学习,奖励信号直接来自任务是否成功。这样一来,写代码和压缩上下文这两件事被放在一起训练,而不是分开优化。

效果体现在数字上:在 SWE-bench Verified 上通过率提升 9.2 个百分点,在 SWE-PolyBench Verified 上提升 5.0 个百分点。

窗口不溢出,收益依然在

一个值得注意的细节是,即便把上下文窗口开到 256K、根本不会溢出的情况下,这种学出来的压缩能力依然带来增益。这说明它的价值不只是"省空间"——当上下文空间不再是瓶颈时,主动压缩仍然有用。

换句话说,压缩在这里更像是一种主动的信息管理,而不是被动的容量救急。

作者把这种主动压缩归为一种"模型-框架协同设计":框架提供压缩机制,模型学会何时调用它、保留什么、之后怎么继续。分工没有消失,只是边界被重新划了一次。

至于这套方法在更大规模上表现如何、跨不同框架是否稳健,目前还没有答案。

另一个悬而未决的方向是组合问题:框架里已经打包好的那些基于规则的压缩技术,怎么和这种由模型主动调用的压缩方式配合起来用。规则负责兜底,模型负责判断时机,听起来合理,但具体怎么接还没定论。