AMAP 团队发布了一个叫 LoopArena 的基准,论文挂在 arXiv 上,编号 2608.28281。它要评估的不是模型写代码有多强,而是模型作为 Controller 时,能不能引导一个独立、固定的 Worker 编码智能体把长任务跑完。
外层循环能力才是考点
打开网易新闻 查看精彩图片
这里的关键词是“外层循环”。模型不是自己动手写每一行,而是站在外面指挥一个 Worker 去干活。Worker 是固定的,不会变聪明,也不会换人。模型得靠自己的调度、纠偏和决策,把任务一步步推进到结束。
为什么这个角度有点意思
过去很多基准都在测编码智能体本身,比如能不能过测试、能不能修 bug。LoopArena 把镜头挪开了:如果 Worker 不变,换不同的 Controller,结果会差多少?这其实是在问,模型当“指挥”的水平,是不是被低估了。
目前公开的信息只到发布这一步,具体怎么打分、任务长什么样,还得看论文细节。但至少有一点很清楚:写码能力之外,模型能不能稳住一个长任务的节奏,正在被单独拎出来量一量。
热门跟贴