13个AI智能体,近12天,没有分配任务,没有中央调度。它们自己找活干,最后交出了1703项贡献。
这是英伟达一篇论文里描述的实验。核心问题很具体:如果让多个编码智能体同时研究同一个问题,怎么防止它们重复做别人已经做过的实验,又怎么让每个智能体在别人验证过的结果上继续往前走。
他们的答案是把Git当成共享内存。
每一次结果都变成一次提交
在这套名为Agora的设计里,每一个结果、假设和验证动作,都会被记录成一次不可更改的Git提交。
父边指向的是这条结论建立在哪些已有结论之上。索引则列出当前还有哪些开放分支,以及哪些结论已经被验证过。
这样一来,智能体不需要靠中心节点告诉它"该做什么",它只要读一遍仓库,就知道哪些路已经走过了,哪些结论可以拿来当地基。
论文里提到,这套机制要解决的是重复实验的问题——让智能体不去重复彼此的实验,同时能在别人已经验证过的结果上继续搭建。
没有训练数据,也没有梯度更新
实验的设定本身就不寻常。13个LLM工作节点,运行了将近12天,没有分配任务,也没有中央规划器。
它们要做的事情是:从141个供体模型里,初始化一个1.196亿参数的混合模型。前提是没有训练数据,也不做梯度更新。
换句话说,这不是常规意义上的训练,而是在已有模型之间做组合与筛选,靠智能体之间的协作把结果一点点逼近目标。
最终,工作节点一共发布了1703项贡献。
评估指标从3.39降到1.899
衡量结果的一个关键指标是每字节比特数。评估器从3.39降到了1.899。
论文给出的说法是,这补上了与训练过的GPT-2 124M之间62%的差距。
另一个数字同样值得注意:165次独立复现全部成功。
复现全部成功这件事,在智能体协作类实验里并不常见。它说明这套基于Git的记录方式,不只是让智能体之间能互相看见,也让外部能够沿着提交历史把结果重新走一遍。
论文地址是 arxiv.org/abs/2609.18094。
热门跟贴