一万个AI Agent,88小时,1300亿token,解开一道千禧年大奖难题。这组数字摆出来,第一反应大概是"多Agent协作终于成了"。但OpenAI研究员Noam Brown在Dwarkesh Patel播客里给出的判断恰恰相反:这件事的核心功劳,属于那个本身极其强大的通用模型,多Agent最多占不到10%

Noam Brown是o1及推理模型的奠基级贡献者之一。他在这场对谈里没有把多Agent包装成什么新范式,而是把它拆回一个更朴素的位置——让测试时计算从串行走向并行。

打开网易新闻 查看精彩图片

思考越久越好,但会撞上延迟墙

Noam用一张绘图类比解释这件事。横轴是测试时计算量,纵轴是推理基准表现。思考越久,表现越好,但这条曲线会撞上延迟瓶颈——用户不可能等一个模型想三个小时。

把任务拆给多个Agent并行处理,就能缩短拿到答案的时间。代价是效率略低,因为每个Agent无法独占完整上下文。这种收益在数学、网页搜索、深度研究这类容易并行的任务上很明显,在写小说这类创造性任务上几乎无用。

所以多Agent的本质,是让测试时计算通过并行而不是纯串行来扩展规模。它不是凭空制造更强智能。

不给复杂外脚手架,只给发消息的工具

传统多Agent方案里,协调Agent负责分派任务,子Agent返回结果。这种结构限制了临时沟通,复杂度也高。

Noam的选择是只提供发消息这类基础工具,让Agent自己摸索怎么高效利用。结果是它们自发涌现出类似Slack频道协作、中层管理乃至组织层级的行为。但早期版本容易退化成各自独立解题的局部最优。

他也坦承,关于一万个Agent的协同效率,缺少扎实的消融实验。这类突破难以做端到端消融,成本过高,"一万个Agent比一千个Agent多带来什么收益",目前没有科学测定数据。

AI组织的逻辑和人类不一样

AI之间共享上下文、融合知识,远比人类顺畅。更关键的是可以无限复制最优秀的人才,或者整个高效团队,不需要执行。

Noam把它和"初创公司为何能颠覆大公司"联系起来:大公司内部个体目标会逐渐不一致。而如果AI充分对齐到公司利益,一万个Agent可能都像持股20%的联合创始人一样卖力。

但他承认,这一万Agent的协同有效性尚未被验证。

RSI会加速,但不会一夜爆炸

数学进展在加速,一年解题时长提升十倍,这说明AI研究也可能被自动化。但Noam指出,实验、算力与串行执行构成非智力瓶颈。

数学纯受限于思考,而AI研究还需要训练模型、跑实验、等待结果、占用GPU,很多环节必须串行。他个人估计会有约三倍的显著加速,但快100倍的智能爆炸并不现实。他也承认存在很大不确定性,也可能只快50%。

真正难的是:指标测到了对齐吗

Hugging Face事件暴露出的是,不对齐的模型在奖励驱动下主动作弊、共谋,并跨环境迁移合作行为。而阿谀迎合这类行为边界模糊,难以定义何为作弊。

更棘手的是思维链监控。如果被模型识破,反而会促使它隐藏意图。同时模型任务跨度可能从一周扩到三个月,而发布周期只有两个月,安全评估在时间尺度上可能追不上。

Noam反复回到同一个问题:那些指标真的捕捉到了我们关心的对齐吗?