私有测试集权重提升
Artificial Analysis 发布 Intelligence Index v4.3,将 Terminal-Bench 从 2.1 升级到 4.0,并新增 AutomationBench-AA——一个带私有测试集的智能体工作流自动化基准。官方说明,这是 Intelligence Index v5 分批推进的一部分,v4.2 和 v4.3 的每项改动都独立成立,目标是把指数拉向更接近真实世界的问题解决,同时增加私有测试集防止刷分,并降低分数饱和。
由于 AutomationBench-AA 采用与 Zapier 合作保留的测试集,私有任务或私有答案的评估权重从 40% 提升到 45%。类别权重与 v4.2 保持一致:智能体 30%、编程 20%、通用 30%、科学推理 20%。
Terminal-Bench 升级到 4.0
Terminal-Bench 从 2.1 升到 4.0,包含 66 个多步骤任务,测试智能体在沙箱中通过终端驱动的任务,覆盖软件工程、机器学习、科学和运维。4.0 版本重新校准了算力和时间配额,并改进了任务说明与验证方式。测试框架从 Terminus 2 换成 mini-SWE-agent,一个更精简、模型无关的框架。官方还提到,后续会很快把 Terminal-Bench 4.0 纳入 Coding Agent Index,用于测试模型与框架组合。
AutomationBench-AA 替换 τ³-Banking
AutomationBench-AA 是 Zapier 的 AutomationBench 的实现版本,测试智能体在模拟应用(如 Gmail、Slack、Salesforce、Jira)中完成 657 个业务流程。智能体需要在遵守业务规则的前提下完成目标任务。该基准使用 Zapier 的私有任务集。
热门跟贴