智猩猩AI整理
编辑:知知
代码已经交给 Agent 写了,开发者却还得守在一旁:看进度、补要求,再时不时追问一句「接下来呢?」
最近,Loop Engineering在 AI 开发者中热了起来。它要做的,就是把这份持续安排工作的职责也交给系统:人来确定目标和要求,由 Loop 根据执行反馈,组织 Agent 一轮轮往下做。
那么,负责控制这个 Loop 的模型,该选谁?
阿里巴巴 DreamX 团队开源的LoopArena,把这个问题变成了一项专门的 Benchmark。
GPT、Claude、DeepSeek 等五个模型同台,执行编程的 Agent 保持不变,比较的正是模型在长程 Loop 中的控制能力。
这项工作论文登上 Hugging Face Daily Papers 当日榜首。
Daily Papers 主理人Ahsen Khaliq(AK)随后在 X 上分享了这项工作。DAIR.AI、Rohan Paul 等海外 AI 媒体和博主也迅速跟进。
海外博主Shashank Ashtikar在转发 DAIR.AI 的介绍时直言:“太需要这样的工作了!”
他认为,许多组织和团队已经在交付 Loop,却一直缺少真正评估它们的办法。看到 LoopArena,他的评价很直接:“太棒了!”
另一位博主 Brain Cramps 则把 LoopArena 列入了自己整理的「将影响 AI 领域的七件事」。
从 Terminal-Bench 4.0 到 DeepSWE,最近的新模型发布,越来越看重 Agent 处理复杂任务的表现。榜单值得看,跑榜的账单也不轻:仅在 Terminal-Bench 4.0 的公开榜单上,就有多组评测记录的总费用达到数千美元,个别接近一万美元。
针对 Loop 中的下一步控制决策,LoopArena 则准备了轻量的 Type I 评测,无需在评测时重新运行 Coding Agent。按其 arXiv 论文公布的结果,一个模型测完整套 Type I,估算模型调用成本最低只需 0.31 美元。
上手也很轻便:环境和模型接口准备好后,跟着仓库里的快速示例,5 分钟即可上手 Type I 评测。
论文题目:
LoopArena: Benchmarking Models as Runtime Controllers for Loop Engineering
01
从写 Prompt,
到设计持续工作的 Loop
过去,开发者和 Coding Agent 的配合,常常是一问一答。交代任务,检查结果,再决定下一句该怎么说。Agent 负责写代码,人负责把整个过程往前推。
Addy Osmani 在讨论 Loop Engineering 的文章中,将开发者的职责描述为设计一套能持续给 Agent 安排工作的系统。人确定目标和验收要求,Loop 根据运行反馈接着安排工作。
比如,要给一个已有项目增加新功能。前期需要找对实现位置;功能写好后,要检查它是否影响原有行为;到了交付前,还要确认验证结果覆盖了任务要求。同一个目标,推进到不同阶段,需要的下一步并不相同。
这些判断需要跟着代码和运行反馈更新。就好比一位技术负责人(Tech Lead),要看懂当前进展,判断接下来该推进实现,还是先补上验证。
LoopArena 关注的,就是模型在这个位置上究竟表现如何。
已有的编程评测让我们了解一套 Coding Agent 完成任务的能力。LoopArena 将其中的外层控制单独拿出来比较,让研究者可以有针对性地评测负责这一角色的模型。
对于已经在搭建 Agent 工作流的团队,这样的比较很实用。选哪个模型来负责后续安排,设计的控制策略有没有效果,都可以放进同一套评测里检验。
02
同一个 Coding Agent,
五个模型轮流指挥
研究者将编程执行与外层控制解耦:负责读代码、修改仓库、运行测试的 Coding Agent 称为Worker;在长程 Loop 中读取进展、决定后续安排的模型称为Controller。后者是 LoopArena 要评测的对象。
在模型对比中,团队固定 Qwen3.7-Plus 作为 Worker,同时统一工具、任务环境、执行预算与评测方式,只更换 Controller。
图 1|LoopArena 论文主原理图。Controller 根据运行反馈指导 Worker,任务结果由统一的评测器检验。
这套分工在运行时很直观。Worker 完成一轮工作后,系统会整理进展和相关执行记录,交给 Controller。Controller 据此决定下一轮要推进什么、需要补充哪些验证,或者是否可以结束。
如果继续工作,它就给 Worker 一份具体安排。论文称之为 Loop Contract:说明下一轮的目标、要保留的已有行为,以及完成这一轮的条件。新的执行结果回来后,Controller 再作判断。
Controller 不直接改代码,它的决策通过 Worker 落地。上一轮安排带来了什么结果,下一轮还要根据反馈调整。在这样的连续交互中,模型指导任务的表现就可以被观察和评测。
任务结束时,评测器检查实际代码与行为。这让控制决策和最终任务结果联系起来,模型给出的建议也有了执行层面的检验。
这种固定 Worker、比较 Controller 的做法,也让 X 用户 cixier 留下了一句直白的评价:“Worker 锁死、只考 Controller,这才像在测 agent。”
首批评测覆盖 GPT-5.5、Qwen3.7-Plus、Claude Opus 4.8、DeepSeek-V4-Flash 和 GLM 5.2。
在完整任务评测中,GPT-5.5 排名第一,Qwen3.7-Plus 紧随其后。完整成绩和实验设置已经公开,社区可以沿用这套条件,接入自己的模型进行比较。
03
从下一步决策,
到完整任务,都能测
一次控制判断和一整段连续工作,可以放在不同的评测中考察。LoopArena 设计了三类评测,让研究者按自己的问题选择投入。
Type I:下一步,怎么选?
模型阅读一个控制点的任务进展,从候选指令中选择接下来的安排。题目的答案有实际执行结果作依据:在构建基准时,团队已经运行过候选方案,比较了它们带来的后续结果。
等到评测新模型时,这部分执行不必重做。模型只需完成控制决策,就能得到成绩,适合快速考察下一步判断。
Type II:从中途接手,继续往下带。
评测从准备好的中间状态开始,让 Controller 指导 Worker 完成接下来的一个阶段。代码会真实执行,反馈也会持续更新,多轮控制的过程保留在这段工作里。
研究者可以直接观察模型如何应对运行中的新情况,不必为每次尝试都重复前面已经完成的开发工作。
Type III:从开始到交付,全程参与。
任务从原始仓库状态启动,覆盖调查、实现和验证,直到决定结束。Controller 要根据整个过程的进展持续安排工作,最后接受完整任务的验收。
图 2|LoopArena 论文原图。单次决策、任务切片与完整任务,分别对应不同的研究需求和评测投入。
04
想研究长程控制,
预算也能更从容
对学生和小团队来说,长程 Agent 研究有个很实际的门槛:一个新想法,往往要等整套任务跑完,才能知道有没有效果。模型调用的账单也跟着每一轮尝试增加。
LoopArena 的 Type II 为此提供了一个低成本入口。它取自对应的完整任务,并与 Type III 一一配对,让团队可以直接检查:少跑前面一段,能否仍然得到有参考价值的模型比较?
在论文实验中,Type II 的平均估算模型推理成本比配对的完整任务降低约六成,同时,模型排序与完整任务评测高度一致。
这对日常研究意味着,可以先用任务切片比较不同模型、尝试新的控制方法,再把选中的方案放到完整任务上评测。同一份预算,就有机会支持更多轮想法验证。
关注+星标,获取AI前沿进展与开源一线动态
热门跟贴