评估一个AI Agent,第一步该做什么?搭平台、接LLM Judge、盯分数——这是多数团队的标准动作。Hamel Husain与Shreya在教导了700多名工程师之后,给出了一个反直觉的答案:先手动读完100条真实Trace。
他们的判断很直接:评估的本质是理解系统在哪里影响了用户,这一步没有自动化捷径。跳过它,后面搭起来的一切都建立在虚假的安全感上。
平台不是起点,失败模式才是
多数团队的错误路径高度一致:先搭平台,再接LLM Judge,然后开始看分数。这套流程看起来专业,问题在于顺序反了。
平台、Judge、分数都是工具,工具不该成为起点。真正的起点必须是具体的、可观测的用户痛点与系统失效模式——而这些东西不会自己浮出来,只能靠人一条条读Trace去发现。
只有亲手阅读真实Trace,才能看清系统究竟在哪个环节影响了用户。有了这个认知,评估信号的设计才有针对性。反过来,先定指标再找问题,得到的数字往往只是在验证自己的假设。
评估器是长出来的,不是设计出来的
Hamel Husain与Shreya的结论是:评估器源于对真实失败模式的深度理解,而非预设指标。
这个顺序决定了评估的有效性。先读100条Trace,识别出具体的失败模式,评估器会自然长出来——因为你知道要测什么、为什么测。而预设指标的做法,等于在还没看清问题之前就锁定了答案。
“先搭平台、后看数据”被他们称为典型的工程本位思维陷阱。工程团队习惯用工具解决问题,但评估这件事的难点不在工具,在于理解用户实际遭遇了什么。
理解系统在哪里影响了用户,这一步无法用自动化替代。这是他们教导700多名工程师后得出的核心结论,也是所有Agent评估工作的真正起点。
热门跟贴