智猩猩AI整理
编辑: 没方
今天的 Agent 可以写代码、调用工具、执行复杂任务。
但它们在真实世界里产生的大量交互轨迹、执行结果和用户反馈,并不会自动变成下一次进步的“养分”。
模型训练完成后,权重基本固定。Prompt、Skills、工具调用逻辑、记忆和编排规则,也就是Harness,主要依赖人工调试。
这也意味着, Continual Self-Improvement(持续自我改进) 缺少一套能够把“执行-反馈-学习-评估-更新”串起来的基础设施。至于真正的RSI(递归自我改进)那就更远了。
而这正是开源项目Reef尝试解决的问题,核心主张是让推理不再是终点,而是学习闭环的起点。
该项目把“活流量上的经验”转化为对模型权重和整个Harness的持续更新,同时支持热更新、候选版本评估与回滚等机制。
LLaMA-Factory 的作者郑耀威在X上力荐了这个项目,他觉得这种原子化 API 的自我改进设计很干净,比再发一个新框架优雅得多。
项目开发者Ao Qu在回应 Pengqian Han 对 Reef 的评价时表示,希望 Reef 最终能成长为一个高度模块化的 RSI(递归自我改进)基础设施,为不同 self-evolution 方法的构建和实验提供一个共享平台。他目前是MIT 博士生,此前曾在字节跳动 Seed 团队工作过。
01
学习闭环围绕「活流量」
现有的 RL 训练框架如 slime、veRL、AReaL,核心目标是组织 rollout 和模型训练,并不是面向线上真实业务流量设计的推理服务基础设施。
Reef 把这个顺序倒了过来,它先是一个正儿八经的推理服务,基于 SGLang 提供高性能推理,业务流量正常打进来。然后学习闭环围绕这些「活流量」来构建,而不是围着离线数据集转。
具体来说,Reef 端到端掌控了自我改进循环里的三样东西:经验、智能体和更新。
Reef 提供「有状态推理」,应用调用标准的/v1/chat/completions接口时,响应头里会返回一个x-reef-agent-record-id回执;之后应用把评分或反馈 POST 到/reef/report,信号就能精确绑定到那一次推理上。这些轨迹和反馈被存储为结构化的经验流,让不同学习算法可以直接消费这条经验流。
Reef 的团队有一个很清醒的判断,Agent 进化不等于模型权重更新,Harness 同样可以从经验中进化。
所以 Reef 支持模型权重和Agent Harness两个进化路径。
模型侧用改编自 Slime 的分布式训练后端异步产出 checkpoint 或 LoRA 适配器,通过 NCCL 权重同步热更新服务引擎,全程不重启服务。
Harness 侧基于 Cordis 构建,根据轨迹与反馈生成新的 Harness 候选版本。
模型、Harness 和配置都被纳入版本化与评估机制,候选版本需要经过评估后才能激活,并支持审计、比较和回滚。
在线强化学习、测试时扩展、技能进化这些方法,本质上都是把测试时信号转化为系统更新,区别只在学习信号来源、经验获取方式和进化目标三个维度。
因此,Reef 内置了 SAO、OpenClaw-RL、TTT-Discover 等多种配方,还有一个不需要 GPU 的 SkillClaw 配方,专门用 Agent 反馈来进化技能池。同一套基础设施,装不同配方就能走不同的进化路线。
02
使用教程
安装非常轻量,推荐使用uv管理环境:
python3 -c "import reef; print(reef.__version__)"启动一个支持模型权重进化的示例(以SAO配方为例):
curl -f http://127.0.0.1:8900/healthz 接下来,Agent 可以通过 Reef 提供的 OpenAI/Anthropic 兼容接口发起请求。
例如调用/v1/chat/completions,同时通过x-reef-scenario指定当前场景。Reef 会在响应头中返回一个x-reef-agent-record-id,可以把它理解成这一次 Agent 行为的“回执”。等任务完成之后,再把结果反馈给 Reef。
例如任务成功就提交score=1,失败则提交score=0,同时还可以附带更详细的文字反馈。
).raise_for_status()到这里,一个最基础的 Reef 持续学习闭环就跑通了:发起推理 → 获得 Agent Record → 完成任务 → 提交 Reward/Feedback。
后续 Reef 就可以基于这些积累下来的交互记录和反馈,进一步触发 Recipe 对模型权重或者 Harness 进行更新。
03
推理层正在变成学习层
过去,推理和训练是两套相对割裂的系统:模型在线上负责回答问题,训练系统则在离线环境中等待下一轮数据。
Reef 探索的方向,是把二者重新连接起来。当每一次真实推理都能被记录、获得反馈,并进一步反哺模型或 Harness,推理本身就不再只是能力输出,而成为持续学习的入口。
这或许也是 Agent 从持续学习走向 RSI 的一条务实路径。
关注+星标,获取AI前沿进展与开源一线动态
热门跟贴