ClawGym II 框架带来一种新思路:把 OpenClaw 或 Claude Code 当作黑盒,直接纳入强化学习(RL)训练循环,无需访问其内部机制。
在 ClawGym-Bench Pass@1 基准上,该方法效果显著。经 OpenClaw 训练,分数提升 9.98 分;经 Claude Code 训练,提升达到 14.81 分。
打开网易新闻 查看精彩图片
混合训练同样有效
除了单一模型训练,混合训练方式也被验证可行。框架能力还扩展到了 JobBench 和 OfficeQA 等更多评测场景。
这套方案的核心价值在于,不依赖模型内部结构,仅通过外部反馈就能持续优化智能体表现,为黑盒场景下的智能体训练提供了可复用的路径。
热门跟贴