- 论文标题:ClawBench:Can AI Agents Complete Everyday Online Tasks?
- GitHub: https://github.com/TIGER-AI-Lab/ClawBench
- 项目主页: https://claw-bench.com/
- 论文链接: https://arxiv.org/abs/2604.08523
- Hugging Face: https://huggingface.co/collections/TIGER-Lab/clawbench
如果你觉得 AI agent 离帮你订机票、填报销单、投简历只有一步之遥,那 MMLU-Pro 的作者联合滑铁卢大学 TIGER Lab,UBC NAIL Group 和 UniPat AI,CMU 等机构刚刚放出的这项研究,可能会让你冷静下来。
ClawBench,一个让 AI agent 在144 个真实生产环境网站上执行日常任务的新评估框架,结果堪称惨烈:
最强的 Claude Sonnet 4.6,每三个任务就要翻车两个。GPT-5.4 更是只有 6.5%—— 在 153 个任务中仅完成 10 个。 而且,153 个任务里有 68 个(44.4%)没有任何一个模型能做对。一个都没有。
不是 "AI 会不会用浏览器" 的问题,
是 "AI 能不能替你干活" 的问题
现有的网页 agent 评测,大多长这样:
- WebArena:在自己搭的沙箱里测,网站是假的,页面是静态的,能出什么错?
- OSWorld:虚拟机里跑,就 9 个应用,翻来覆去测那几招。
- Mind2Web:更省事,直接拿录好的操作轨迹考选择题 —— 连浏览器都不用开。
前沿模型在这些评测上能轻松拿到 65%-75% 的分数,看上去让 agent 执行现实任务指日可待。
但 ClawBench 干了一件不一样的事:它让 AI 用浏览器直接接入真实网页。不是沙箱,不是模拟器,是人们每天都在用的那些生产环境 ——Google Flights、DoorDash、Zillow、Instacart、Airbnb、LinkedIn、Doodle……144 个平台,153 个任务,覆盖了从购物、订票、投简历到填保险报价单等 15 个日常类别。
而且 AI 要解决的不是 "搜一下某个航班多少钱" 这种只读任务。ClawBench 考的是写操作 —— 下单、预约、提交申请、发送消息。换句话说,它考察的是 AI 能否作为用户的 “替身”,完成真正需要通过交互改变和理解网站状态的复杂任务。
结果是:那些沙箱里的高分,在真实网站上几乎清零了。
论文的原话一针见血:
"Strong performance on existing web-agent benchmarks does not transfer to everyday write-heavy tasks on live production websites."
翻译过来就是:你以为的学霸,换了个考场直接交白卷。
安全难题:怎么让 AI 随便点,
又不让它真把钱花出去?
这个基准有一个绕不开的技术难题:你让 AI 在真实网站上执行写操作,它万一真下了个订单、真投了份简历、真发了一封邮件 —— 谁来背锅?
ClawBench 的解决方案很巧妙,叫做final-request interception(终态请求拦截)。
具体做法是:人类标注员先把每个任务完整走一遍,标记出那个 "不可逆的最后一击" 是哪个 HTTP 请求 —— 比如 DoorDash 上的 "下单" 按钮对应的 POST 请求。然后,在 AI agent 执行任务时,系统通过 Chrome 扩展和 CDP(Chrome DevTools Protocol)监控所有出站流量。论文报告了一个让人放心的数字:在 153 个人类参考运行中,拦截器 100% 捕获了所有终端请求,零误伤导航流量。
换句话说,AI 可以像人类用户那样正常浏览、搜索、填表、点击,在真实网站上走完全程,— 但当它试图发出那个标记好的终端请求时,系统直接拦截,请求永远到不了服务器。 AI 可以在网站上 "走完全程",但影响真实世界的扳机永远不会真的扣下去。
不是 "不够聪明",
而是 "最后一公里" 集体恐惧症
论文最有意思的发现,藏在失败轨迹的细粒度分析里。
表面上看,Claude Sonnet 4.6 的失败是因为人工验证墙拦截(Cloudflare、DataDome 验证码直接拒掉自动浏览器)、登录卡关、填错表单字段这些 "硬伤"。
但有一个问题在所有模型身上反复出现,论文称之为 "last-mile non-commitment"—— 最后一公里恐惧症。
什么意思?Agent 能把前面的步骤全做对:找到正确的网站、搜到正确的商品、点进正确的页面、填好正确的表单…… 然后,在需要点那个 "提交"/"确认"/"下单" 按钮的时候,它停住了。
论文里有一个让人哭笑不得的案例:
ClawBench 任务 780:在韩国美妆网站 Soko Glam 上完成一次购买流程。Claude Sonnet 4.6 完美地找到了商品、添加到购物车、进入结算页面、开始填收货地址 —— 然后在输入街道地址打到一半的时候,轨迹戛然而止。没有点击 "提交订单",没有发出任何提交请求。171 秒,121 个浏览器操作,全部正确 —— 只差最后一步。
论文统计显示,八个模型中有六个,大量失败轨迹都堆积在 "已到达最终确认页面但未提交" 这个阶段。
另一个让人意外的发现是:失败轨迹消耗的浏览器操作数量,比成功轨迹还要多。Claude Sonnet 4.6 的失败运行中位操作数是 120 次,而成功运行只需 64 次。Gemini 3 Flash 的失败中位数是 74 次,成功是 45 次。
这说明什么?AI 不是探索不够,而是在原地打转。碰到验证码就反复刷新、遇到表单校验不通过就重复填、被反爬墙拦住就不停重试 —— 大量的 token 和 API 费用,烧在了毫无进展的死循环里。
GPT-5.4 怎么了?14 个工具调用就交卷
这张成绩单上,最让人意外的不是谁赢了,而是谁崩了。
GPT-5.4,OpenAI 的旗舰模型,在 ClawBench 上只拿了6.5%。153 个任务完成 10 个。
但比这个数字更离谱的是它的行为模式:
- 平均每个任务只做 13 次工具调用(Qwen 3.5 是 42 次,Sonnet 4.6 是 61 次)。
- 85 个任务上直接主动退出(agent_exited),是自己说 "我完事了" 然后走人。
- 中位运行时长只有196 秒,而 Sonnet 4.6 的中位数是 593 秒。
论文的诊断是 "early termination"—— 不是能力不够,是根本没认真做。GPT-5.4 似乎倾向于 "快速判断任务太复杂然后放弃",而不是像 Sonnet 4.6 那样坚持到要么成功要么撞墙。
而在它真正尝试的任务里,又暴露出另一种问题 ——"假完成"(false completion):
ClawBench 任务 2:在 DoorDash 上点一个 Big Mac 和一份 20 块麦乐鸡。GPT-5.4 搜到了麦当劳、点了 Big Mac、加了购物车 —— 然后 Agent 自己宣布 "Both items are correct",认为任务完成。但实际上,订单根本没提交,购物车里只有它自己以为的两样东西。
换句话说,GPT-5.4 不仅不爱干活,干的时候还经常干错了自己还不知道。
Qwen 3.5:开源模型的体面
在一片愁云惨雾中,Qwen 3.5 是唯一值得多看两眼的亮色。
26.1% 的完成率(排名第二),每个任务的 API 成本只有$1.02—— 是 Sonnet 4.6 的七分之一。每个成功百分点消耗的 token 是所有模型里最低的,平均每次任务只做 42 次工具调用,是 "最能打的高效选手"。
更难得的是 Qwen 3.5 展现出的执行纪律。论文中有一个典型案例:任务要求在一个叫 Insurify 的保险报价网站上填写一份超长的多页表单。这个任务有大约 40 个连续的屏幕页面,涉及级联依赖字段(比如邮编错了后面的选项会变)。Qwen 3.5 以 "单调的快照 - 操作循环" 一页一页地推进,遇到两次字段依赖陷阱(加拿大邮编被拒 → 切换到美国邮编;日期控件输入格式不对 → 自动切换输入方式),都自行恢复了,最终完成提交。
同一任务,GPT-5.40 次操作直接退出,Gemini 3.1 Flash Lite9 次操作后闲置超时。
当然,26.1% 离 "能用" 还差得远。但它说明一件事:在真实世界的 agent 任务上,开源模型靠执行纪律 —— 而非模型尺寸,已经可以和闭源旗舰站在同一个量级竞争。
GLM-5:最省钱的玩家
智谱的 GLM-5 是另一个值得关注的数据点。
24.2% 的完成率,综合排名第三,但每个任务的 API 成本仅$0.64—— 不到 Sonnet 4.6 的十分之一。在成本 - 性能坐标系上,GLM-5 是最接近原点的那一个。
不过 GLM-5 有一个明显的短板:48.4% 的任务因超时(30 分钟时限)而终止,是八个模型中最高的。这说明它能打,但打得慢:在需要长程规划和持续行动的任务上,时间不够用。
谁在什么任务上称王?
答案是:没有人能通吃
上面详细解读了结果中重要信息,然而 ClawBench 按场景拆分的成绩单,揭示了另一个有趣的发现:不同模型擅长的领域完全不同,没有一个模型能做到面面俱到。
- Shopping(购物):Sonnet 4.6 以 62% 碾压全场。
- Social(社交):Sonnet 4.6 拿下 75%。
- Work(工作):GLM-5 以 38.1% 登顶,Sonnet 排第三。
- Dev & Tech(开发技术):Haiku 4.5 和 Gemini 3 Flash 并列第一,只有 27.8%—— 但也比 Sonnet 的 11.1% 好出一倍多。
- Travel(旅行):Qwen 3.5 和 Gemini 3 Flash 并列第一,Sonnet 只排第四。
- Job Search(找工作):全军覆没,最好的 Haiku 4.5 也只有 12.5%,Sonnet 0%。
- Automation(自动化):Sonnet0%。 这种 "东边亮了西边灭" 的格局说明:当前的网页 agent 不是一种通用能力,而是一堆参差不齐的领域特化表现的拼凑。一个在购物网站上大杀四方的模型,可能在求职网站上连第一步都走不动。
人类 vs AI:
同样的浏览器,完全不同的玩法
ClawBench 还记录了一个数据维度,在其他 benchmark 里几乎从没被认真对待过:交互动力学。 论文对比了人类和 AI agent 在同一套 Chromium 浏览器里的操作特征,差距大到像是两个物种:
人类打字是逐键按下,AI agent 是整段文本瞬间灌注(type 动作)。人类有鼠标轨迹,AI 直接做像素级点击跳转。这种 "不像人" 的行为特征,恰恰是很多反爬系统一眼识别出 bot 的原因。
论文的潜台词很明确:AI agent 在真实网站上失败,不只是因为 "不够聪明",也因为 "动作太不像人"—— 而这恰恰是那些沙箱 benchmark 永远不会暴露的问题。
Anti-bot:AI agent 面前最硬的墙
在所有失败原因中,出现频率最高的不是一个技术难题,而是一个工程现实:反爬虫系统。
Cloudflare Turnstile、PerimeterX、DataDome…… 这些网站用来识别和阻挡机器流量的系统,成了 AI agent 面前最坚固的马奇诺防线。
论文中有一个典型案例:
GLM-5 被要求去 Zillow 上搜索多伦多市中心的一居室公寓并提交租房申请。它打开 Zillow,迎面撞上 PerimeterX 的 "按住以确认你是人类" 对话框。接下来的 33 个 turn 里,它尝试了点击拖拽、DOM 探测、甚至注入合成触摸事件 —— 都失败了。最后,它放弃 Zillow,自己决定换到另一个网站(viewit.ca),搜索了 "Toronto downtown" 后陷入闲置。任务失败。
最讽刺的是,GLM-5准确地诊断了问题—— 它清楚地描述出 "这是一个 Cloudflare 或类似的 bot 保护页面,验证机制专门设计来检测和阻止自动化交互"。但知道问题是什么,和能解决问题之间,隔着一条它跨不过去的鸿沟。
这种事在 ClawBench 上反复发生:AI 能识别出 "我刚才被验证码挡住了",但就是过不去。和人类比起来,这些模型在真实互联网的 "入场资格" 上就输了一截。
ClawBench 和 ProgramBench:
两条路,一个结论
如果你觉得这个标题似曾相识,没错,2026 年 5 月,我们曾经报道过 SWE-Bench 原班人马发布的ProgramBench:让 AI 从零重建 FFmpeg、SQLite、ripgrep 等真实软件项目,结果 Claude、GPT、Gemini 全部 0% 完成率。
ClawBench 和 ProgramBench,一横一纵,指向了同一个结论:
ProgramBench 考的是 "AI 能不能当软件工程师":从零设计和实现一个系统。答案是:不能。
ClawBench 考的是 "AI 能不能当你的私人助理":替你在真实网站上完成一件日常琐事。答案是:基本不能。
两者加起来,画出了一条清晰的战线:AI 在受控环境下的代码生成和网页导航已经很强了,但一旦面对真实世界的复杂性 —— 需要长期规划、多步执行、应对意外、理解上下文 —— 当前的模型距离 "可用" 还有巨大的鸿沟。
这不是一个 "再加一年数据和算力就能解决" 的问题。ProgramBench 暴露的是系统级架构能力的缺失,ClawBench 暴露的是真实环境交互鲁棒性的缺失 —— 这两个问题,都不是靠简单地 "再大一点、再多训一点" 就能自然解决的。
所以,我们离 "AI 替我干活" 还有多远?
ClawBench 的 33.3% 天花板,翻译成日常语言大概是这样: 你让 AI 帮你在三个网站上各做一件事,它能完整做对其中一件。剩下两件,要么半途而废,要么被验证码挡在门外,要么填了表但不敢点提交,要么自己宣布 "搞定了" 但实际上什么都没发生,要么干脆直接退出。
但换个角度看,三件事能做对一件,在三年前是一个笑话,在今天是 33.3%。
ClawBench 真正的价值,不在于给 agent 的能力打出一个低分,而在于第一次系统性地测量了 "AI 从实验室走到真实互联网" 这一跃的距离有多远。论文里的五层轨迹记录、Agent-as-Judge 协议、final-request 拦截机制,构成了一个可以反复测量这个距离的标尺。 下次当有模型在 ClawBench 上拿到 50%、70%、甚至 90% 的时候 —— 那才是真正值得激动的时刻。
作者简介
张宇轩,英属哥伦比亚大学博士生 (个人主页: https://yuxuan.world/),主要研究方向为Agentic AI,Reinforcement Learning,Auto Research, Recursive Self-Improvement,LLMs,相关成果发表于ICLR,COLM,EMNLP等国际会议。
王钰博,滑铁卢大学博士生 (个人主页:https://wyyyb.github.io/),MMLU-Pro一作,主要研究方向为Behavior of LLMs, multimodal reasoning, evaluation,相关成果发表于NeurIPS,ICLR,COLM,EMNLP,ACL等国际会议。
热门跟贴