把几个不同的开源大模型凑在一起,理论上限确实会抬高。但NVIDIA团队测完八种筛选策略后发现,实际跑出来的准确率,往往还不如池子里最好的那一个单模型。

这项研究针对的是多智能体系统里一个很实际的问题:到底该把哪些模型放进池子。团队围绕规模、准确率、答案多样性、错误多样性四个维度,设计了八种选择策略,并在路由、多数投票、LLM-as-judge三种配置下,用高难度科学基准做了对比。

打开网易新闻 查看精彩图片

池子越大,理论上限越高,实际越低

结论里最反直觉的一条是:不同开源模型组成的池子越大,理论上的最优准确率确实会上升。但真正跑出来的成绩,经常低于池子里表现最好的那个单模型。

也就是说,多模型组合带来的不是稳定增益,而是一种"上限好看、下限难看"的分布。团队还发现,用同一个模型的多个副本,效果反而比混搭不同模型更好。

这个结果直接挑战了"模型越多样越好"的直觉。多样性在理论上能覆盖更多错误模式,但实际执行中,不同模型之间的能力差异、输出风格差异,反而可能互相拖累。

多数投票:单模型从29.4%提到32.2%

数据层面最清晰的一组对比来自多数投票。对最好的单模型做多数投票,HLE准确率从29.4%提升到32.2%。而几乎每一个混合模型组合,成绩都是下降的。

这说明多数投票本身是有价值的机制,但它的收益来自"同一个模型的多次采样",而不是"多个不同模型的拼盘"。把不同模型塞进投票池,等于把不同标准的答案混在一起统计,反而稀释了信号。

八种策略里,提升幅度最大的一种,是从单一模型家族里挑选候选。相比一个独立的单模型,这种做法的改进最明显。家族内模型共享训练血统和输出习惯,组合起来的一致性更高。

加模型之前,先测它到底加了什么

研究给出的操作建议很直接:在往路由器或集成系统里再加一个模型之前,先测量它究竟带来了什么增量。

这句话针对的是当前多智能体系统搭建中的常见做法——默认模型越多越强,先堆上去再说。NVIDIA这组实验说明,堆叠本身不产生收益,甚至可能拉低整体表现。

  • 不同开源模型混池:理论上限升,实际准确率常低于池内最优单模型
  • 同一模型多副本:效果优于混搭不同模型
  • 多数投票:最优单模型从29.4%升至32.2%,混合模型组几乎全降
  • 八种策略中提升最大:从单一模型家族内选候选

对正在搭多智能体系统的团队来说,这份研究的价值不在于给出一个万能配方,而在于把"加模型"这个动作从默认操作变成了需要验证的决策。池子里每多一个模型,都应该先回答一个问题:它到底补上了什么。