ICML 2026 Oral论文CausalGame公布了一项颇为残酷的评测结果:30款当前最顶尖的大语言模型智能体,在面对因果推理任务时,全部折戟。

没有一款模型通过测试。研究团队据此指出,哪怕是大众眼中能力超群的LLM,在科学发现所必需的因果推断能力上,依然近乎空白。

打开网易新闻 查看精彩图片

这也说明,被频繁提及的“AI科学家”离真正意义上能够自主完成科学发现,仍有不小的距离。