一个常见的问题是,AI智能体(AI Agent)在改动之后性能似乎变差了,而没人知道是什么原因导致的。系统提示词可能被改过,工具描述可能被更新过,底层模型可能换到了另一个版本。任何一项变动都会影响智能体的行为。如果没有一致的测量方式,剩下的就只有猜测和反复手动测试。

评估(Evals)提供了一种测量这些变化的方式。它给智能体一个任务,运行它,然后按照一组既定标准检查结果。同一套流程可以在不同版本和不同改动上重复执行,差异因此变得更容易被发现。你不再需要对智能体的行为做出笼统或主观的判断,而是能描述出具体、可测量的变化。这给了你一个明确的问题去排查,也给了你一个方法去验证某次改动是否真的改善了结果。

打开网易新闻 查看精彩图片

本文涵盖以下内容:

  • 为什么智能体比单轮LLM调用更难评估,以及这如何影响测试设计
  • 如何找到并编写具有清晰产出的评估任务
  • 针对推理、工具调用和最终结果该用哪些评分器,以及何时组合使用
  • 如何构建一个能产出有用结果而不制造不必要噪音的评估框架
  • 评估如何与监控配合使用

我们先来看看是什么让智能体评估与众不同,以及这应该如何影响你设计测试的方式。

理解为什么智能体评估不一样

单轮评估很容易理解:一个提示词,一个回复,评分器拿它和预期答案比对。智能体打破了这个模型。一个智能体会对任务进行推理,选择工具,执行动作,观察结果,然后重复——有时要重复几十轮——而每一步都可能出错。