东京大学一项新研究给AI智能体评测算了一笔账:多数测试任务其实在浪费资金。论文指出,所有版本都能通过或都无法通过的任务,在测试集中占比超过70%,却和其他测试承担着相同的成本。
这些“无效任务”无法区分模型能力差异,却拉高了整体评测开销。研究团队提出的新方法Task-CoEvolve,只保留过往版本表现有分歧的测试,每轮重新选取,并调整评分机制以支持跨轮比较。
打开网易新闻 查看精彩图片
20%任务,还原全量结果
在Terminal-Bench 2.1基准上,Task-CoEvolve仅用89项任务中的20%进行评测,结果与全量评测相差约一项任务。成本随之降低67%至80%,评测时间也缩减一半。
这意味着,AI智能体评测可以用更少的资源获得接近全量的结论,为高频迭代测试提供了更经济的路径。
热门跟贴