一个评估集,只是你构建它那天产品需求的快照。之后,产品在变,用户在变,模型在变,连那些"黄金答案"本身也会漂移。原文作者给出的判断很直接:把评估集当成一份活资产来对待。

评估集为什么会"腐烂"

打开网易新闻 查看精彩图片

评估集不是一次建好就能永久使用的标尺。原文指出,产品、用户、模型乃至黄金答案都会在构建之后发生漂移。这意味着,一套曾经精准反映真实需求的测试用例,会随着时间推移逐渐脱离实际。

作者给出的应对方式有四条:给它做版本管理;每周用真实生产环境中的失败案例去喂养它;淘汰那些不再代表真实流量的用例;按计划重新检查标签。

100%通过率为什么是警告

原文里有一句话值得单独拎出来:一个半年没人碰过的评估集,上面跑出100%的通过率,无论仪表盘怎么显示,这都是一个警告信号。

逻辑并不复杂。评估集如果长期不更新,它衡量的就不再是当下的产品表现,而是一份过时的标准。通过率越高,越可能说明这套题已经跟不上真实场景,而不是产品真的没有问题。

把评估集当活资产

原文给出的操作路径可以归纳为:

  • 版本化:让评估集的每次变化可追溯
  • 每周注入真实失败案例:用生产环境的问题更新题库
  • 淘汰失效用例:不再代表真实流量的案例应当退休
  • 定期复核标签:黄金答案本身也需要重新检查

这套做法的核心,是承认评估集会随时间失效。作者没有给出具体工具或流程细节,只强调了一点:评估集需要被持续维护,而不是建完就锁进抽屉。