同一个模型,在CursorBench榜单上会出现好几个分数。不是榜单算错了,是评测方式变了。

CursorBench是Cursor内部的编码智能体评测套件,任务全部取自真实的Cursor IDE会话,特点是模糊、跨多个文件。任务类型覆盖代码库理解、找bug、编辑、重构、规划和代码审查。每个模型会在多个推理档位上分别评测,榜单同时记录正确率、平均成本、token用量和每个任务的智能体步数。

打开网易新闻 查看精彩图片

分数为什么不是一个数

榜单把推理档位拆成了五档:Low、Medium、High、Extra High、Max。大多数模型在每个档位上各占一行,而不是被压缩成一个总分。

原因在于每个推理档位都在分数、成本和延迟之间做权衡。档位调高,模型有更多推理预算,正确率可能上去,但单任务成本和耗时也跟着涨。把五档揉成一个数字,等于把这个权衡关系抹掉了。

所以看这份榜单的正确率,得先看它挂在哪个档位下面。同一模型在Low和Max上的表现,本来就不该被当成一回事。

4.0和3.x不能直接比

CursorBench 4.0从2026年9月10日起在公开榜单上报告成绩。此前展示的3.x结果在任务集变更时被归档,原因是4.0的分数与更早版本不可比。

任务集换了,分数体系就换了。拿4.0的成绩去对3.x的历史数字,得出的结论没有意义。这一点对做模型横评的人尤其重要——跨版本拉时间线,很容易把任务难度变化误读成模型能力变化。

榜单图表报告的是正确率,越高越好。数据导出里保留了每个模型对应的推理档位,以及单任务成本、token用量和步数。

它测的不是补全

CursorBench的任务从真实Cursor会话里收集,被刻意设计成模糊且跨文件。这意味着它考的是智能体式的、理解整个仓库的编码能力,而不是孤立的代码补全。

补全类评测里,模型看到的是局部上下文,填对下一段就行。而跨文件、需求模糊的任务,模型得先搞清楚要改哪里、为什么改,再动手。这两件事对模型的要求不在一个层面上。

榜单保留全部推理档位作为独立条目,而不是给每个模型一个单一数字,也是出于同样的考虑:真实使用中,没人会只在一个固定档位上跑任务。