机器人Agent跑多轮任务,最怕"书包太重"——查了几十轮,上下文越堆越长,真正有用的信息反而被淹没。2026年集中出现的五个项目,X-OmniClaw、MemoHarness、HumanCLAW、RoboClaw和RPent,都在回答同一个问题:怎么为机器人、物理Agent搭一套Harness。

其中MemPO给出的答案有点反直觉:不要外部记忆模块

打开网易新闻 查看精彩图片

让模型自己写"小纸条"

传统做法是外挂一套复杂的记忆检索系统,把历史信息切片、向量化、按相似度召回。MemPO绕开了这条路。

它的机制是:在构建下一轮prompt时,让模型在每个assistant轮次的开头,自己写下一段记忆摘要。系统只保留最近一轮的工具结果,其余全部交给模型自己压缩。

这相当于逼着模型在交互过程中学会一件事——什么值得记、怎么记。而且不是靠人工规则,是靠强化学习端到端训出来的。

用一句更直白的话说,MemPO是让AI学会"边做笔记边推理",用RL奖励训练它把最重要的信息压缩进每轮的小纸条。查的轮次再多,书包也不会越来越重。

奖励怎么给,才是真难题

让模型自己写摘要,马上会遇到信用分配问题:任务最后成功了,到底是哪一轮的记忆写得好?

MemPO设计了双通路奖励机制来拆这个问题。

  • 全局轨迹级的结果奖励(Outcome Reward):全序列广播,衡量整条轨迹的任务正确性
  • 局部记忆奖励(Memory Reward):基于P_mem减P_full的差值计算,只作用于记忆区间

两条通路协同,一边优化记忆质量,一边优化任务正确性。记忆写得好不好,第一次有了可归因的优化信号。

这也正是MemPO的核心目标:不仅要"用RL训练Agent",还要为记忆本身设计可学习、可归因的优化信号,让模型在交互中主动压缩、组织并保留最有助于任务完成的信息。

环境不是Gym,是Agent Loop

MemPO的环境完全是自己实现的,基于VeRL框架加SGLang推理引擎定制。

它不是传统强化学习里的Gym环境,而是一个异步多轮Agent Loop在充当环境角色。具体实现是ToolAgentLoop异步状态机,通过停止词机制截断模型输出,再动态注入真实RAG检索服务的结果。

这套设计让系统"自己既是环境也是Agent",形成闭环。

落到源码层面,MemPO对VeRL框架的修改被梳理成三条核心路径:A是记忆奖励计算与叠加,B是结果奖励计算,C是系统主循环与工具调用。改动集中在数据收集、优势函数和主循环三个层面,属于外科手术式修改,而非推倒重来。

从"更强的模型"转向"更好的系统",这五个项目指向的是同一个判断:机器人Agent的下一程,拼的可能不是模型参数,而是Harness怎么搭。