AI写代码越来越快,审代码的AI却一直没个统一考卷。GitHub这次把尺子摆出来了。
GitHub发布开放基准ReviewBench,专门用来评估AI代码审查智能体。评测集不是随手凑的:187个开源仓库、219个PR、覆盖19种语言。
打开网易新闻 查看精彩图片
为什么是这219个PR
打开网易新闻 查看精彩图片
关键在于分布参考。ReviewBench的题目设计参照了1.039亿次pull request的真实分布,让评测集尽量贴近实际代码审查场景,而不是挑一批理想化的样本。
对做代码审查智能体的团队来说,这意味着多了一个可对齐的公开坐标。
热门跟贴