ReviewBench 是 GitHub 在 2026 年 10 月 5 日发布的开放基准,专门解决一个正在变现实的问题:AI 代码审查工具越来越多,但谁查得准、谁废话多,一直没有一把公认的尺子。它现已开放使用,任何团队都可以拿自己的审查智能体来跑分并提交到排行榜。
这把尺子是怎么造的
基准的样本分布参照了 GitHub 上超过 1 亿个真实拉取请求,最终选出 219 个公开 PR,覆盖 19 种语言、187 个开源仓库,并刻意保留了多文件、有实质审查价值的中大型改动。参考答案不是单一来源拍板,而是把真人审查意见、后续修复提交、静态分析工具和多个前沿模型给出的发现汇总,去重后再按同一套公开标准逐条判定真伪。发布前,未参与构建的高级工程师从头复标了一遍,与基准的判断一致率达到 96.6%。
分数不只看查中多少
每条发现都标了严重程度和类别,指标同时给出基于已知答案的精确率与召回,以及把答案之外的新发现也送去判定后的增强指标。这样做的用意很具体:只盯关键问题、还是宁可多报也不能漏,不同团队的偏好不同,排行榜可以按严重程度、类别和精确与召回的权重重新排序,而不是挤在一个总分里。GitHub 说,用这套离线信号评估自家 Copilot 代码审查后,预判线上实验方向的把握明显变大;其中一次多模型组合审查的实验,离线预估和线上结果同向,线上被采纳率、召回和评论量分别上升,单次审查成本反而下降,关键问题评论的增幅预估也和实测接近。
谁该现在就去跑一遍
自研或采购了 AI 审查工具的团队最值得先跑:提交流程是登录后登记自己的智能体,先在 25 个 PR 的测试集上调,再跑完整的 219 个做正式成绩,结果经维护者审核后才公开。对普通开发者,它的直接价值是以后选审查工具时,能按自己在意的安全、正确性或低噪声去看分项,而不是只听厂商报一个总分。