打开网易新闻 查看精彩图片

作者:Eval研究小组Yoky、张奚晨

当大家已经看腻了所谓一个更比一个强的Benchmark刷榜,什么样的场景能真正评价Agent和模型?

硅星人想到的答案是:让AI打实时对抗的游戏。在AgenTank游戏中,让Agent来玩Tank击杀游戏,如果你还没有了解过,可以看看下面这场冠军对战:

比赛分为1v1个人赛和3v3团赛,均以击毙对方或者吃到更多的星星为获胜条件,玩家可以在创建坦克时选择不同的技能,并针对该技能制定相应的策略。

于是,在这个刚结束的周期长达14 天的比赛里,我们联合 30 个社区和顶尖高校 AI 社团, 450 名选手、500 多辆 Agent Tank,消耗近千亿 Token,完成了一次大规模 Agent 众测。

在对战的过程中,我们发现区别于传统静态的BenchMark,在实时对抗的游戏环境里,比赛周期长、版本迭代多,对手的能力和策略都在变化,Coding Agent不能只写好某个JS文件,还要在多轮失败、回放、日志中分析失败原因迭代坦克,直至发布新版本,再重新跑一遍这个闭环。

实时对抗还带来了动态博弈。没有任何策略是绝对制胜的:今天能赢大多数人的打法,明天可能被某个对手专门针对;团队赛里,策略还要根据队友分工和敌方行为重新调整。

最终,AgenTank 测到的是模型、Agent Harness 和人机工作流的综合能力,而不是单纯的裸模型智商。

1

测评说明与全局总览:

本次测评的数据集均来自选手在 AgenTank World Cup 中使用的参赛模型和 Agent的数据,而不是等量控制的实验室样本。

打开网易新闻 查看精彩图片

因此,不同模型的样本量天然不均:有的模型被大量选手使用,留下了更多迭代版本、更多坦克和更多杯赛出场;有的模型样本较少,甚至部分维度缺少源码证据。为了避免把低样本偶然性写成确定结论,我们在总览表格里同时展示版本数、坦克数、杯赛出场和估算置信度。

最终的测评结果对应的不是游戏里的孤立技巧,而是实际工作中选择 Agent 时真正关心的问题:谁更会写可维护代码,谁更有全局观,谁能适应变化,谁能组织工具链,谁能把长任务持续推进到稳定结果。

所有的AI,无论模型还是把模型藏在里面的Harness工具、模型产品等,最终都要解决真实场景的问题。于是在普通用户那里,解决问题最重要,管你是模型还是什么,一视同仁。

这也解释了为什么我们会把 Codex、Cursor、Claude Code、GLM、Agnes 等放在同一张表里。

打开网易新闻 查看精彩图片

这次评测不是纯模型 API 跑分,而是还原选手真实使用的 Agent 栈:有些选手并不区分自己用的是 IDE、Coding Agent 还是底层模型,只关心它能不能把坦克写出来、改得动、打得赢;同时,同一个 Harness 可能不断切换模型,同一个模型也可能接入不同 Harness,组合太多,单独按产品或模型拆都会失真。

我们按“实际承担主要 coding、规划和迭代工作的能力来源”归类:产品主导时看产品/Agent 栈,模型变化主导时把模型作为参考维度。

因此,我们把这次Eval评测拆成五个维度:代码质量分、全局规划能力、实时任务适应、技能与工具编排、长程任务能力。

打开网易新闻 查看精彩图片

这张图是本次测评的总览表。我们把每个模型 / Agent 栈在不同能力维度上的得分拆开呈现,包括代码质量、全局规划、实时适应、工具编排、长程追踪和杯赛使用等指标;颜色越深,代表该维度得分越高。需要注意的是,这里的“画像分”不是胜率,也不是裸模型 API 排名,而是基于真实参赛代码、回放、版本记录和出场数据综合得到的能力画像。

打开网易新闻 查看精彩图片

以下是经过众测后得出五条最核心的结论:

  1. Claude 更像架构师,Codex 更像工程执行者。
    Claude 更擅长把握宏观框架、搭出清晰结构,但后期处理精准细节时可能出现失真;Codex 架构能力没那么强,却更像一把便宜、高频、精准的手术刀,哪里有问题就直接改哪里,在动态环境里的适应性更好。

  2. 国产模型已经有局部 coding 亮点,在静态代码能力上,甚至部分优于顶级模型。这次比赛里,国产模型和顶级模型在代码质量上的差距没有想象中那么大。

  3. 国产模型真正落后的地方,是全局规划和长程执行:一旦策略从单个函数扩展成一套持续迭代的系统,就更容易出现目标前后不一致、代码越叠越厚、修复后缺少验证闭环的问题。但在实时响应上,国产模型反而有一些亮点,GLM、DeepSeek、Doubao在明确场景下能较快补出针对性策略,说明它们对局部变化的反应并不弱,弱的是把这些反应长期组织成稳定系统。

    打开网易新闻 查看精彩图片

    模型决定静态代码上限,Harness 决定了动态适应的结果
    模型能力足够强时,它决定第一版代码的质量、架构和策略上限;但任务进入动态环境后,胜负就不只看模型会不会写,而看 Harness 能不能帮它记住状态、调用工具、读取回放、处理上下文,并把失败反馈转化成下一轮调整。

  4. Agent 的自反馈能力决定它能不能从工具走向独立。一个 Agent 的水平,不是由某次生成的代码、某一局胜负,或者某个模型榜单分数决定的;评判标准应该是:代码能不能长期维护,目标能不能持续记住,环境变化后能不能调整,工具和技能能不能被组织成策略链,失败以后能不能自己复盘、修复并验证。

接下来我会继续拆解每一项评分标准,以及这些分数分别对应到 AgenTank 对战中的哪些具体能力。

1

一、工程能力及代码质量

首先说明的是,工程能力分不是胜率,也不代表最终排名。它衡量的是 Agent 能不能把“能跑的策略”做成“能长期维护和迭代的工程系统”;代码质量只是其中最基础、也最关键的一项。

打开网易新闻 查看精彩图片

在这部分对工程能力和代码质量的评测中,主要考察函数组织、边界检查、决策出口、代码可读性和注释质量。为减少少数样本带来的误差,我们只统计有效样本数N≥4的模型,并取质量最高的4个样本计算均分。

同时,AgenTank的规则中已经对代码做了初步限制,即代码体积需在200K以内,在同时击中等特殊判定中,代码运行时间也会成为决定胜负的依据之一。

打开网易新闻 查看精彩图片

从选手的实际用法来看,模型选择不是单选题,是组合题。

Claude适合搭策略基座,代码体积克制、结构清晰、完成度高。Codex便宜、产量大,适合跑更多轮试错。不少上榜坦克先用Claude搭好策略骨架,再交给Codex或国产Agent跑迭代,在质量、效果和成本之间找性价比。

但这种接力不总是成功:有选手让DeepSeek为Codex生成的函数补注释,结果始终无法准确对齐原有策略,只能放弃。也有选手认为GLM的策略生成和落地效果不够,成本又没有优势,最终换回Codex。工程接力的前提是接棒者能理解前一棒的架构意图,国产模型的弱项也在于此。

Cursor的优势不完全来自底层模型,而是与IDE结合得更紧。个人赛和团赛都上榜的选手解释道:对一个已经迭代了几十上百版的tank来说,找准该改哪里比写代码本身更重要。进入长程任务后,拉开差距的是Agent工作流是否完备,而不是不停的烧Token。

国产模型与第一梯队的差距集中在工程闭环和稳定性。局部改写、轻量执行、特定战术中能打出亮点,但长程任务里选手仍然选Claude们。

体感上,国产模型驱动的Tank容易在某个段位停滞,迭代不是做不了,但更依赖人持续跟进催促;Claude和Codex则能自己走完从生成到测试到发布的完整流程。有选手搭了本地模拟器作为发版门槛,新版本必须通过36到72场全胜才允许发布,国产模型写出的代码没能通过本地测试,策略根本没走到发布节点。

1

二、长程任务能力

长程任务把时间拉到14天、上百个版本,考验的是Agent能不能在很多轮迭代之后,还记得自己要干什么,还能把失败转化成下一轮修复。

AgenTank在计算长程能力时,先折叠内容相同的重复保存多点几次保存不算有效迭代。真正进入评分的,是版本链里发生过实际变化、能延续目标、能处理失败反馈的有效推进。

打开网易新闻 查看精彩图片

整体来看,长程任务比其他几项更难拿高分。多数模型在“演进稳定性”上都不差,它们不太会把代码直接改崩。真正拉开差距的是两件事:能不能在很多轮之后还围绕同一个目标推进(持续跨度),以及能不能把失败转化成修复动作(修复闭环)。

打开网易新闻 查看精彩图片

Codex领先,不是因为版本多,而是它在长链路里更能保留目标,代码演进没有明显失控。它更像一个能被长期驱动的工程型Agent,可以在几十个版本里持续接住任务,把前一轮的问题和下一轮动作串起来。

相比之下Claude写得清楚、稳健,但当任务进入很多轮反馈和修复时,它的长链路推进证据不如Codex。代码质量第一的模型,在长程任务上只排第三,尤其在进入第50个版本迭代后,Claude的代码质量开始出现比较大的波动和下降。

打开网易新闻 查看精彩图片

长程任务是国产模型最吃亏的一项。GLM 的表现相对最好,说明它有一定持续追踪和修复能力;Kimi K3 则体现出另一种典型问题:它能持续迭代,但迭代方式更像不断往上叠代码,后期容易形成屎山和状态栈错乱。

DeepSeek V4、MiniMax M3 的问题则更偏向闭环不稳:能补局部代码,但很难持续记住目标、读结果、定位问题、修复并验证。国产模型在这里暴露出的核心短板,是从“完成一次修改”到“长期托管一个任务”之间还差一整条工程链路。

1

三、全局规划能力

代码写得好,不等于知道下一步该往哪走。

AgenTank中,坦克可以获取地图、墙体、星星、敌人和队友等信息,但每一帧的行动都受视野、移动距离、转向成本和技能冷却限制。全局规划考察的是:Agent能否围绕地图、资源和长期目标安排连续行动,而不是看到敌人就开火、看到星星就追。

打开网易新闻 查看精彩图片

测评同时检查源码和回放。源码看Agent有没有路径搜索、资源优先级、跨帧状态和战略仲裁结构;回放看这些设计是否真的转化为有效行动,避免「代码里写了规划,实战里依然乱跑」。

打开网易新闻 查看精彩图片

Claude在这里出现了一个有意思的反差:代码质量分很高,全局规划分却不突出。它更擅长把代码整理成清楚的结构,但在逐帧变化的环境里,结构清楚不等于目标稳定。连续打起来,目标容易散。于是不少选手在Harness层补上跨帧状态,比如用行为树加黑板机制,让坦克记住上一轮目标,在攻击、躲避、追星之间维持优先级,而不是每帧从零判断。

在全局规划上,国产模型的表现比代码质量更能暴露差距。GLM、DeepSeek、MiMo 在部分规划指标上有信号,说明它们能理解路径、资源和目标这些基本概念;但多数国产模型的问题是目标容易断:这一帧会抢资源,下一帧又被敌人或局部收益牵走,连续几步看不出稳定计划。

ZCode、Mavis Agent在代码质量分上分数不低,在全局规划上没有同步跟上,说明“会写清楚代码”和“能组织长期行动”是两件事。国产模型要补的不是单个 BFS 函数,而是把路径、资源、风险和状态放进同一个决策系统。

当模型记不住的目标,只能由Harness替它记住。实战中,选手通常会在Harness或策略架构里补上跨帧状态。

例如myth-tank训练中采用了“行为树+黑板”机制,让坦克不再每帧从零判断,而是能记住上一轮目标,并在攻击、躲避、追星和蹲草之间持续调整优先级。

(双方在对战过程中进行补帧)

团队赛多一层考验:单个Agent的判断能不能服从团队分工。Agnes-Go初期就出现过两辆坦克争抢同一颗星、彼此卡住的情况。复盘后不同坦克逐渐形成分工,存活追星、持续火力、开局猛攻各司其职,再把分工固化进共享约束。这里的全局规划不只是「我下一步去哪」,而是「我们接下来几步怎样不互相打架」。

反过来,即使每辆坦克都是最强坦克,其局部判断都合理,但若一辆坦克选择埋伏,另一辆却主动出击,团队仍可能输掉比赛。

1

四、实时任务适应能力

实时适应,是AgenTank对模型和Agent最严苛的考验之一。战场在变、对手在变,同一个对手的打法也在持续升级。进入王者段位后,蹲草、突击、转向甩弹已是常规操作,甚至有人会针对榜单头部坦克专门编写反制代码。

很多选手把AgenTank的模式类比做“黑客攻防”,不跟进跌打,马上掉分掉段位;改的太紧太多,又可能“打赢一局,改坏全局”。这就很考验实时复盘迭代能力,比如来自超参数的冠军选手就在他迭代工作流中设置了门槛条件,不仅要在不同地图上击败旧版本、胜率超过60%,面对其他技能坦克时也表现也不能退步。

打开网易新闻 查看精彩图片

所以,实时适应不只是看单帧反应有多快,更要看Agent能否在对战中识别变化,在失败后找到原因,并把有效调整写进下一版策略。

实时适应主榜的分差非常小,在这个维度没有绝对领先者,不同Agent走了不同的路线,也有着不同的弱点。

打开网易新闻 查看精彩图片

Codex的缺点是执行效率低下。这和我们前面的测评观察是相呼应的,即Codex能主动通过观察战局,把战场变化写进策略,但这也表现为代码不断堆叠、体积持续变大,进而导致运行时间变长。

Claude和Cursor 更像保守但表现均衡的选手,除事件响应稍弱外,没有明显的短板但运行可靠性很高。代码通常结构清晰、保护条件充分、运行稳定,但策略仍可能偏向固定优先级和安全规则。它们能可靠处理眼前事件,却不一定持续积累对手信息,也不会频繁重组整体打法。对于需要长时间运行的复杂任务来说,这种稳定性尤为关键。

实时适应是国产模型最容易打出局部亮点的地方。GLM、DeepSeek、Doubao 在执行速度、局部反应和对战术变化的处理上都有有效信号,尤其是面对明确场景时,它们能较快补出针对性策略。

但问题也在这里:如果只针对某个对手、某个技能或某种打法做特化,短期可能上分,长期会牺牲泛化胜率。国产模型在这一部分更像“反应不错,但稳定复盘不足”:能看见局部变化,也能改出局部补丁,但还不够稳定地判断这个补丁是否会破坏整体策略。

1

五、技能和工具调用能力

不少Agent写出的代码,看起来什么都能做,移动、射击、放技能、躲子弹一项不少。有时这些工具组合在一起,反倒互相打架,输掉对局,体现在代码层就是追星逻辑让坦克往前冲,避弹逻辑又让它后退;技能冷却还没结束,代码已经开始尝试释放。

打开网易新闻 查看精彩图片

好的策略代码,需要做好技能和工具调用,有一个合理的指挥逻辑,让Tank先看清战场,再决定这一刻应该用的技能和工具,最后只执行最合适的动作。

除Codex在工具覆盖和情境映射部分有明显优势外,主榜模型之间策略链路的差距其实没有想象中大。

打开网易新闻 查看精彩图片

Codex的优势表现在,它不仅能把移动、射击、技能、资源和敌人感知都写进代码,还会根据不同局势改变用法。让同一个技能,在追击、保命和抢资源时,有着不同的触发条件。

个人赛冠军(CCS超参数)即是在另一个层面印证了Codex的编排能力。他用Codex串起读取回放、分析问题、修改代码、运行测试和决定发布的完整流程,说明它擅长把多个工具和步骤组织成一条连续、可验证的工作链。

这个部分,国产模型体现的差距不在“会不会调用工具”,而在能不能把工具组织成策略链。Doubao、DeepSeek、MiMo 在局部动作组合上能打出一些分数,说明它们知道什么时候移动、攻击、躲避或释放技能;但工具之间的关系常常没有被统一管理,比如资源、冷却、风险、目标优先级各算各的。

GLM 相对更完整,但仍然缺少顶级模型把“状态判断—候选动作—评分选择—执行验证”串成闭环的稳定性。简单说,国产模型能写动作,但还不够会编排动作。

Agnes由于自建了Harness层,通过清晰保留日志、版本和工具调用记录等,让中途报错等任务也能接着断点继续跑。

1

结尾:

接下来,我们也会把 AgenTank 继续往更标准化的 Benchmark 方向推进:进一步完善指标口径、扩大样本规模、沉淀可复现的数据集和评测方法,并尝试把这套实时对抗评测写成论文发布出来。我们希望它不只是一次杯赛复盘,而能成为观察 Agent 能力演进的一种长期方法。

如果你也在关注 Agent Benchmark,或者有更多实时对抗、动态协作、长程任务场景的想法,也欢迎一起参与进来。今天的 Agent 评测还远没有定型,静态题库只能回答一部分问题;真正复杂的能力,往往要放进会变化、会反馈、会互相博弈的环境里才能看清楚。我们希望和更多研究者、开发者、参赛者一起,把这件事做得更专业。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

点个爱心,再走 吧