从"演示惊艳"到"值得信赖",中间隔着一条名为"评测"的鸿沟。
先讲一个此刻正发生在数百个工程团队里的故事。
打开网易新闻 查看精彩图片
一个团队为法律检索构建了一套RAG应用。他们用40道精心挑选的问题做了测试,答案看起来不错,于是向合伙人团队演示。合伙人印象深刻,应用随即上线。
上线三周后,一位律师助理标记了一个错误——某个答案引用了不正确的法条。工程团队打开仪表盘:忠实度(faithfulness)分数0.91,衡量答案是否基于检索文档生成,健康。答案相关性,也健康。
但他们没检查的是上下文召回率(context recall)——衡量检索器是否返回了全部必要信息,而非只返回一部分。在生产环境中,检索器一直在多跳法律问题上悄然失败。这类问题需要从两份文档中获取信息,而不仅仅是一份。
作为优秀的语言模型,模型从不完整的上下文中构建出了听起来合理的答案。忠实度很高,因为答案确实基于已检索到的内容;答案错误,因为检索到的内容本身不完整。
系统通过了团队运行的所有评测,却败在了他们不知道需要运行的那个评测上。
这就是2026年AI评估工程的核心挑战:你只能捕捉到你衡量的东西,而知道该衡量什么,本身就是大多数团队尚未建立的能力。
这份手册将为你和你的团队建立这种能力。读完后,你将构建一套完整的、生产级的AI评估平台,覆盖RAG管线、智能体系统和多轮对话,具备自动化CI/CD门禁、LLM-as-judge评分、实时生产监控和黄金数据集管理系统。
每个概念都有可运行的代码实现。完整平台代码见配套仓库:github.com/aayostem/
热门跟贴