Zoom 团队做了一组对照实验:176 组匹配设置4 个模型,把编码智能体的执行循环固定下来,只动三个变量——规划、动作空间、上下文管理。

测试基准选的是 SWE-Bench Verified 和 Terminal-Bench 2.1。前者考真实代码仓库里的问题修复,后者考终端环境下的任务执行。两个基准都指向同一件事:智能体能不能把活干完。

打开网易新闻 查看精彩图片

为什么要把 harness 单独拎出来

编码智能体的表现,通常被归因于模型本身。但这组实验的前提是:模型换着用,harness 的配置才是被逐一变化的对象。执行循环不变,变的只有规划方式、动作空间大小、上下文怎么管。

换句话说,同一套循环里,这三个旋钮拧到不同位置,结果会不一样。176 组匹配设置就是为了让这种差异可比较。

三个变量各自意味着什么

  • 规划:智能体是先想清楚再动手,还是边走边看
  • 动作空间:它能调用哪些工具、能执行哪些操作
  • 上下文管理:历史信息怎么保留、怎么丢弃

这三项都属于 harness 的设计取舍,不是模型权重能决定的部分。Zoom 团队把它们拆开逐一变化,等于把工程侧的选择摆到了台面上。

对做编码智能体的人来说,这组实验的价值在于:当模型不再是唯一变量,harness 怎么设计就成了可以单独讨论、单独优化的对象。