独立搜索再对答案,效果反而更好

让多个研究智能体一上来就互相交流,听起来像是协作,实际上可能把整群智能体带进同一条死胡同。一篇新论文指出了一个反直觉的现象:当一个智能体率先找到一个看似合理的答案,其他智能体就会不自觉地围着这个答案打转,不再去测试别的可能性。

打开网易新闻 查看精彩图片

论文把这种现象称为“过早共识”。问题不在于智能体不够多,也不在于它们沟通太少,而在于沟通发生的时机太早——在还没有足够证据可供审查之前,就让它们交换了想法。

ArcticSwarm的隔离搜索机制

针对这个问题,论文提出了一个叫 ArcticSwarm 的方案。核心做法是:在搜索阶段,阻止部分被选中的智能体读取同伴的中间结果,让它们各自独立探索;等搜索结束之后,再把所有发现汇总到一起进行审查。

这样一来,每个智能体在形成判断之前,不会被别人的“初步答案”带偏。它们先各自走不同的路径,最后再坐下来对答案、互相挑战。

82.6%对78.8%,隔离带来的差距

在 BrowseComp-Plus 基准测试上,使用 Qwen 3.5-27B 模型时,ArcticSwarm 达到了 82.6% 的准确率。如果把搜索隔离机制拿掉,准确率掉到 78.8%。再把审查系统也一并移除,准确率进一步下滑到 74.5%

作为对照,论文还测试了 40个独立单智能体各自运行、最后用多数投票决定答案的方式,结果准确率只有 63.5%。这个数字远低于 ArcticSwarm 的表现,说明单纯堆数量或者让智能体更频繁地沟通,都不是解决问题的关键。

先探索,再挑战,最后达成一致

论文给出的结论很明确:对于没有可靠验证器的困难研究任务,正确的顺序应该是先给智能体留出空间,让它们探索不同的方向;等到有了初步发现之后,再对领先的答案进行挑战和验证;最后才让整个智能体群体达成一致。

换句话说,协作不是越早越好。把“对答案”的环节往后放,让每个智能体先独立完成搜索,反而能避免整个群体被一个看似合理、实则错误的早期答案带偏。