一个AI客服代理处理退款,九次工具调用全部规范:拉订单、查物流、调客户档案、两次检索退款政策、确认无工单、建工单、记录时间线、正确读取政策。然后它把工单标记为"已解决",回复用户"您的问题已解决,还有什么可以帮您?"

两处出错。承运商的异常状态仍然挂着,要求的终态本应是"暂缓、待处理";而用户真正问的问题,从头到尾没得到回答。

打开网易新闻 查看精彩图片

检查工具调用的评分器会看到九次规范调用。检查代理是否写入数据库的评分器也会看到写入。但数据库不同意。

507个有状态工作流,每个跑20次

这个落差就是 ThinkingBox 要测量的东西。它覆盖 507 个有状态业务流程,每个任务对多个大模型独立运行 20 次,评分依据是终态后端状态和副作用,而不是生成的句子。该项目现已通过 Hugging Face 开放。

工具调用不等于结果。最终回复和合法的工具调用只是代理指标。一个代理可以听起来完全正确,却留下错误的值、改错记录,或者制造出多余的副作用。只有它留下的记录能回答这个问题。

落差相当大。在一项覆盖 12 个大模型、121,680 次有效试验的公共集消融测试中,79,853 次尝试未通过可执行检查。在这些失败中,67.24% 仍然干净地终止、调用了改变状态的工具、且没有报告最终的工具有错误。

可执行检查仍然在其中 77.61% 的案例里发现了字段值错误,43.30% 发现了非预期的额外副作用,25.36% 发现了缺失的必要副作用。这些状态检查的发现存在重叠。

一条轨迹是一个声明。数据库状态是证据。重复是信任测试。

一次成功不等于可靠

一个代理正确处理了一次退款、接下来四次都搞砸,它就不是一个能用的退款代理。所以每个任务独立运行 20 次,每次从相同的干净后端出发,报告三个不同的数字。这里使用的"20/20"是字面计数:507 个任务中有多少在 20 次尝试里全部通过。没有估算,没有平滑。

先看熟悉的视角。按领域拆分的 pass@1 单次尝试得分估计,这是大多数排行榜发布的数字,单独看像一份普通的能力排名。

Claude Opus 5.5 以 67.16% 总体领先,比 Claude Opus 5 高出三分之二个百分点。Kimi-K3 是最强的开放权重模型,与 GPT-6-Astra 相差不到一个百分点。领域的影响同样大:Claude Opus 4.6 在零售场景拿到 68.62%,在车险场景只有 8.30%。

一次好的运行告诉你模型能做这份工作。它不告诉你模型会不会再做一次。所以每个任务跑 20 次,然后问这个分数有多少能存活下来。

只有三个模型保住了大部分 pass@1 分数:GPT-6 Astra 保留了单次尝试率的 78%,Claude Opus 5.5 和 Claude Opus 5 各保留 71%。另一端,GLM-5.1、Kimi-K2.6 和 DeepSeek-V4-Pro 各自只保住约 8%。

一个模型一次能做到什么,和它每次都能做到什么,这中间的差距就是全部故事。

广度和一致性会分道扬镳

Kimi-K3 拥有测试中所有模型里最广的覆盖。它至少成功解决过一次的任务占基准的 93.89%:507 个任务中的 476 个。只有 31 个任务完全难住它,是全场最低。在零售工作流上它 outright 领先,pass@1 达 82.24%,超过所有闭源模型。

Kimi-K3 同时也是最不一致的模型之一。507 个任务中只有 68 个、即 13.41%,在全部 20 次尝试中都成功。

Claude Opus 5 则相反。它至少成功解决一次的任务更少(79.09%;106 个任务完全难住它),但在每一次尝试中都完成基准的 47.53%。

更新的模型并不能解决这个问题。