同一个模型,换一个终端工具,跑分能差出一截。Epoch AI 的 Terminal-Bench 2.0 把这件事摆到了台面上:榜单上每个模型只列它表现最好的那次组合,但图表里能看到所有提交过的运行记录。
这不是模型能力的问题,是评测方式的问题。Terminal-Bench 测的是模型能不能用电脑终端把活干完——它得看懂 shell 环境,知道有哪些程序可用,还得清楚电脑当前的状态,包括文件系统和正在跑的进程。
一道题就是一个文件夹
一个 Terminal-Bench 任务,本质是一个文件夹,里面装着三样东西:一条指令、一个 docker 环境、一个测试脚本。
模型要做的,是在没人明确告诉它步骤的情况下,自己规划并执行完整个流程。这要求的不只是会用命令,还得有连贯性——前一步的结果要能接上后一步的判断。
换句话说,它得先搞清楚自己站在什么位置,再决定往哪走。文件在哪、进程跑到哪了、上一条命令留下了什么,这些都得自己摸清楚。
模型不是一个人在战斗
跑这个基准的模型,都会配一个智能体工具,帮它持续和终端环境交互。素材里点名的有四个:Anthropic 的 Claude Code、OpenAI 的 Codex CLI、Terminus 和 Goose。
正因为工具会左右成绩,榜单报告的是「模型加智能体」这个组合的表现,而不是单看模型。
这里有个容易被忽略的细节:有些工具会强制或动态调整模型使用的推理强度,而这种调整,用户或评测方在这个场景下既没法纠正,也没法说清楚。
也就是说,你看到的分数里,有一部分来自工具替模型做的决定,而不是模型自己的选择。
分数怎么算出来的
榜单上的分数,是题目集里被解决的任务所占的百分比。
这个百分比通常不是跑一次就定,而是把整套题重复跑多轮,再取平均。
Epoch 的图表会展示某个模型提交过的每一次智能体加模型的运行记录,但榜单和模型页面只列每个模型版本表现最好的那个组合。
所以看榜的时候要留个心眼:排在前面的那个数字,是它最好的一次,不是它的平均水平。
想自己复现,代码是开源的
基准的代码放在 Terminal-Bench 的 GitHub 仓库里,数据则来自 Terminal-Bench 2.0 的榜单。
对做智能体的人来说,这套东西的价值不在于排名,而在于它把「模型能不能真的操作一台电脑」拆成了可复现的任务单元。
指令、环境、测试脚本三件套固定下来,换模型、换工具、换推理强度,变量就能被单独拎出来看。同一个模型在不同工具下分数拉开差距,本身就是一条值得追的线索。
热门跟贴