把多个 AI 智能体放在一起协同工作,和让它们各自为战再投票,谁更靠谱?一位开发者最近用 Gemini 3.5 Flash 和 Antigravity 平台跑了一组对比实验,结果让“群体智慧”的拥趸可能有点尴尬——让智能体实时交流、共享解题进展,效果比事后搞多数投票好得多,个体准确率直接从 72% 冲到了 87%。
实验设计很直接,却正好戳中当下 AI 工程化的痛点:给 30 道来自 Project Euler 的数学编程题,每道题分配 5 个编码智能体,每个智能体都泡在独立容器里,预算时长 30 分钟,外加最多 10 分钟的收尾提交时间。这些智能体被切分成两大组运行:一组“各自为政”,五个智能体闷头干,跑完后汇总答案看多数票;另一组“实时协作”,允许智能体随时沟通进展、共享思路。最后凑出四组可比较的数字——单独个体准确率、单独个体多数投票、协作个体准确率、协作个体多数投票。
赤裸裸的百分比就摆在那里。单兵作战下,5 个智能体独立运行 150 次,答案正确的只有 108 次,准确率 72%;一打开实时协作,同样的配置,正确的次数跃升到 130 次,准确率 87%。再看多数投票,未协作时 30 题靠投票压对 24 题(80%),协作后压对 27 题(90%)。通俗点说就是:临时抱佛脚的“众智”投票,远不如让智能体从一开始就互相通气来得实在。
而且协作带来的好处远不止一个百分比点。从解题耗时的分布就能看出实质优势——协作模式下,有 97 次运行在 5 分钟内就结束了,独立模式只有 77 次;独立模式下超过 30 分钟还没跑完的情况多达 38 次,协作模式降到了 23 次。这意味着,只要有一个智能体率先摸到门道,其他智能体能快速跟上,省去大量重复“撞墙”的时间。最慢完成时间(worst-of-5 time)的分布更直白:独立组里因为总有那么一两个智能体死磕到时间上限,最慢完成时间扎堆在 30‑40 分钟区间;协作组里一旦有解答被共享,整个组的收尾速度都明显加快,大部分问题在第一个解答出现后几分钟内就全组收工。
这也顺便揭开了“多数投票”的底层局限。当你把五个各自为战的答案拿来数票,等来的其实是最后一个、最慢的那个智能体交卷;协作则在解题过程中就把错误路径掐掉了。若用平均解题时间来间接衡量算力和 token 消耗(因为 Antigravity 居然不给精确的 token 计数——后面会吐槽),协作模式的平均耗时也明显更短,等于用更少的计算量拿到更高的准确率,这笔账很清晰。
说到这里,不得不专门点一下 Antigravity。这项实验全程跑在它上面,但作为专门跑智能体的平台,它竟然不提供 token 消耗明细,开发者只能靠“解题时长”来估计成本,因为 token 和算力理论上跟时间成正比。一个号称面向 AI 智能体的基础设施,连基本的消耗详单都端不出来,让想认真算账的人沦落到对着计时器猜成本——如果工程化测试都需要靠秒表来估算计算开销,那所谓“智能体协作落地”恐怕还有一大把账单要补。
除了整体数据,作者还特意提到了几个个别问题(由于 Project Euler 规定不能公开答案,题目细节不便展开),大意是某些题在独立模式下,智能体们反复在同一道逻辑陷阱里打转;而开了协作,交流一圈就能集体绕过那个坑。这其实呼应了人类团队协作的朴素道理:一个人憋三天,有时不如三个人讨论一小时,硅基打工人看来也适用。
这里还必须加一句保真声明:这些智能体并非“可复现的精密仪器”。实验报告明确写了,所有运行都是非确定性的,你要是自己复现,数字可能会有点小浮动,但大趋势应当一致。所以别拿着某一轮实验的精确数值去死磕,看清方向才重要。
实验规模只有 5 个智能体,留下的问号自然比句号多:更多智能体会不会更好?协作遇到极度复杂的任务会不会出现“集体迷航”?沟通开销有没有拐点,再大就反噬效率?这些都还是空白。不过,这至少是一个像样的起点。与之对照,当前离生产环境最近的类似实践,比如 xAI 的 Grok 4 Heavy,据称已经在并行运行多个智能体并对比结果。如果未来工程化平台能把实时共享机制做得更彻底,可能比单纯堆智能体、事后数票更有搞头。
说到底,这件事讲的不是“智能体要不要合作”,而是“怎么合作更划算”。与其让一群 AI 各自埋头算到最后再来核对答案,不如让它们在解题中途就说上话。毕竟那个 72% 到 87% 的跃升已经很直白:在你还在等最慢的那张答卷时,会交流的那一队早就交完卷、占上更高的分了。
热门跟贴