新智元报道
Claude这次,真把AI编程榜单打出断层了!
就在刚刚刷新的MirrorCode排行榜上,Claude Fable 5以64%的绝对成功率再次登顶。
紧追其后的GPT-5.6 Sol,分数只有它的三分之一!
排在第四的GPT-5.5更惨。不仅成绩只有10%,甚至还被自家前辈GPT-5.4按在地上摩擦。
更让人意外的是,在使用Go等高资源语言时,Fable 5的解出率是64%;换成冷门语言Ada,成绩仍然高达61%。
要知道,在开源世界里,Python语料大约是Ada的230倍。
但到了Fable 5这里,成绩居然只下降3个百分点。
这就有意思了。
如果模型主要靠记忆热门语言的语法和常见写法,那么换成Ada之后成绩应该出现下降才对。
而现在的结果,却指向另一种可能——
最强模型已经摆脱了具体语料的牵引,开始学会如何从零构建一个完整的软件项目。
卡死在100%通关线
100亿Token极限测试
具体来说,完整的MirrorCode包含25个目标程序,覆盖Unix工具、解释器、数据查询、生物信息学、密码学和压缩工具等领域。
在这里,模型会被放进隔离环境,没有互联网,看不到原项目源码,也不能下载第三方依赖。它能拿到的只有高层文档、一部分可见测试,以及一个可以反复调用的原程序。
接下来,它要不断向原程序输入数据,观察输出猜内部逻辑,再一点点写出一个行为一致的新程序。
最新榜单从中选出15个Medium和Large目标。每个目标使用两种实现语言,每种语言运行三次。
并且,可见测试与隐藏测试的完成率必须达到100%才算通过,99.9%都不行。
只要漏掉一个边缘案例,整次运行仍然按失败计算。
为了逼模型把最后几个缺口也补上,MirrorCode把单次预算推到100亿Token,最长允许连续运行7天。
论文中成本最高的一次任务更夸张:模型连续跑了19天,单次花费达到2600美元。
在这19天里,模型会反复运行原程序、比较结果、补写功能,再把测试重新跑一遍。报错了就查原因,输出对不上就换假设,局部通过了再去追下一个缺口。
整个过程,更像一场持续数天的调试,而不是一次生成。
gotree的例子最直观。
这个生物信息学工具原本有大约1.6万行Go代码和40多个命令。
Claude Opus 4.7花了14小时和251美元,通过了2001项测试中的2000项,完成度达到了99.95%。
虽然漏掉了一个处理日期注释的冷门边界,被MirrorCode的100%通关线拦了下来,但它已经把原本按周计算的工程量,压进了十几个小时——
Epoch估计,如果不使用AI,人类工程师想要完成同一任务至少需要2到17周。
语料荒漠里,Fable 5只掉了3分
MirrorCode论文曾用StarCoder的公开训练混合作为参照。
其中Python约占8%,Ada只有0.034%,前者大约是后者的230倍。
当然,我们无法知道闭源模型到底见过多少Ada代码。但拿公开生态作参照,Ada有多稀缺已经足够直观。
这门语言主要出现在航空航天、国防和其他安全关键系统中。无论社区规模、教程数量还是开源项目,都远不能与Python、JavaScript或者Go相比。
而Fable 5显然不是在把Go代码逐句翻译成Ada。
它更像是先摸清原程序究竟怎么工作,再换一门语言,把同样的行为重新造出来。
相比之下,其他模型就没这么稳了。
GPT-5.6 Sol从24%降到19%,GPT-5.4从21%降到12%,GPT-5.5更是从17%掉到5%。语言一换,差距立刻被放大。
把整个项目交给AI
如今,Cursor已经让数百个Agent协作近一周,从零写出超过100万行、分布在1000个文件里的浏览器代码。
Anthropic则让16个Claude Agent并行跑了近2000次会话,最终搭出一套10万行、能够编译Linux 6.9内核的C编译器。
OpenAI披露的截至5月Codex个人用户样本中,70.2%至少提交过一次预计超过一小时人类工作量的任务;25.6%提交过超过八小时的任务。
人们交给AI的单位,正在从一段代码、一个bug,变成一个下午、一周,甚至整个项目。
MirrorCode的64%,正是对这种「项目级委托」的一次量化。
它说明,只要目标足够明确,结果能够自动验收,前沿模型已经可以独立做完一部分中大型软件。
对每一个正在把工作交给AI的人来说,变化已经近在眼前——
以前你需要盯着它写每一段代码,接下来,你更可能只在关键节点检查它有没有跑偏。
代码会越来越便宜。
而那些能把问题说清楚、把结果验明白的人,会越来越值钱。
参考资料:
https://epoch.ai/MirrorCode
编辑:摩西
热门跟贴