ClawGym II 框架把 OpenClaw 或 Claude Code 当作黑盒,直接纳入强化学习(RL)训练循环,无需访问其内部机制。这意味着开发者可以在不修改底层代码的前提下,通过外部反馈优化智能体行为。
基准测试成绩显著提升
打开网易新闻 查看精彩图片
在 ClawGym-Bench Pass@1 评测中,该方法经 OpenClaw 提升 9.98 分,经 Claude Code 提升 14.81 分。混合训练同样有效,且框架已扩展至 JobBench 和 OfficeQA 等更多场景。
黑盒思路降低门槛
传统 RL 训练常需访问模型内部结构,而 ClawGym II 绕开了这一限制。对使用闭源工具链的团队来说,这种"只看输入输出"的训练方式,可能更容易落地到实际工作流中。
热门跟贴