GitHub 发布了一个叫 ReviewBench 的开放基准,专门用来评估 AI 代码审查智能体。评测集不大——187 个开源仓库里的 219 个 PR,覆盖 19 种语言。

但它的取样方式值得注意:参考了 1.039 亿次 pull request 的分布。也就是说,这 219 个 PR 不是随手挑的,而是按真实世界的 PR 形态去对齐的。

打开网易新闻 查看精彩图片

为什么需要一把尺

打开网易新闻 查看精彩图片

AI 代码审查这件事,过去一年冒出了不少工具,但各家都说自己好用,却缺少一个公共的评测口径。ReviewBench 想补的就是这一环:把"AI 审代码到底行不行"变成一个可以横向比较的问题。

219 个 PR 的规模不算大,但配上 1.039 亿次 PR 的分布参照,评测集的说服力就不只来自数量了。