Adobe 的研究团队给智能体评测换了个思路:把标准答案写成代码,每次运行都重新取数,再让 AI 评分器对照检查智能体的回答。

在 53 个测试用例上,这种做法的 AI 评分与人类专家的一致率,比用文字描述答案高出 29%,同时少用了 16% 的 token。

打开网易新闻 查看精彩图片

为什么代码答案更管用

文字描述的标准答案容易含糊,评分器只能凭语义猜。代码答案每次运行都重新取数,评分器拿到的是可对照的确定结果,判断依据更硬。

研究还发现一个反直觉的结果:如果没有可对照的答案,AI 评分器的表现还不如随机。评分器本身并不具备判断力,它的可靠性来自那份能跑起来的答案。

论文题为《Skill-based Agentic Evaluation for Real-time Data Science Tasks》。