同一个预算,同样的任务,只因为换了一种组织方式,执行准确率从45.8%跳到了62.5%。Meta 提出的 RankEvolve,把这件事做成了可复现的流程。

两个AI,互为审查者

打开网易新闻 查看精彩图片

RankEvolve 的核心做法是让 Claude Code 和 Codex 作为独立节点运行,彼此审查、修复对方的改动。研究阶段和门控由一套编译协议约束,不是让模型自由发挥,而是把每个环节卡在既定规则里。

单一最佳产品的准确率是 45.8%,双产品组合在同等预算下做到 62.5%。差距来自互相挑错这个动作本身。

推荐模型上的12次迭代

在开源 HSTU 推荐模型上,这套框架迭代了 12 次。MovieLens-20M 数据集上的 NDCG@10 指标,相比已发表结果提升了 4.48%。

多智能体自动研究框架的价值,不在于单个模型多强,而在于把审查和修复变成流程的一部分。