构建基于大模型的 AI Scientist 智能体是当前研究热点,而科学发现的本质在于从观测中挖掘因果关系,因此"区分因果与相关、识别隐藏偏差"的因果思维对 LLM 智能体至关重要。现有 AI Scientist 基准均聚焦于研究流程执行或统计数据分析,没有任何一个显式纳入真实科学发现中广泛存在的选择偏差、测量误差与隐藏混杂挑战。

为此,作者提出 CausalGame:把科学发现中的因果陷阱(选择偏差、测量误差、隐藏混杂)封装成一款"无人机设计"交互游戏,对 30 个前沿大模型智能体进行系统性评测,发现没有任何模型具备可靠的因果思维能力——最强模型生存率仅 68.0%(解析最优 78–85%),且仅 5–7% 的会话在因果推理评分项上拿到分数。

打开网易新闻 查看精彩图片

论文标题: CausalGame: Benchmarking Causal Thinking of LLM Agents in Games 论文地址: https://arxiv.org/abs/2607.04293 项目主页: https://causalgame.github.io

近一年来,用语言模型 LLM 构建 AI Scientist agent 层出不穷,正在成为学术界与产业界共同关注的方向。

从文献综述、假设生成,到自动跑实验、甚至发现超越人类数十年努力的新算法与数学证明,越来越多的证据显示 LLM 在自动化科学发现上的潜力。

但科学发现的内核从来不是"拟合数据里的统计规律",而是识别关键变量、揭示背后的因果机制

一个无法区分相关与因果的 AI Scientist,在面对隐藏混淆、选择偏差和测量噪声时,很容易被观测信号带偏,甚至给出会造成严重后果的错误结论。比如在医疗场景里,把相关当因果可能直接导致错误的治疗方案。

打开网易新闻 查看精彩图片

那么一个直接的问题是:现在用于构建 AI Scientist 的 LLM agent,真的具备因果思考的能力吗?

针对这一问题,来自 MBZUAI、卡内基梅隆大学、香港浸会大学 TMLR Group、牛津大学和纽约大学的研究者提出了 CausalGame:一个通过交互式游戏来评测 LLM agent 因果思维能力的 benchmark。

一、AI Scientist 的下一道坎:从“执行科研”到“发现机制”

过去两年,针对 AI Scientist 的工作大多关注科研流程的不同环节:想法生成、数据分析、代码实现、交互式发现、实验设计。

这些能力都很重要,但还不够。科学发现最困难的地方,往往不是从数据里找到一个相关性,而是在相关性看起来非常合理的时候,意识到它可能只是选择偏差、测量误差或隐藏混淆制造出来的假象。

对 AI Scientist 来说,这正是从"科研流程自动化"走向"真正科学发现"的关键门槛:它能否区分相关与因果?

一个不会区分因果与相关的 AI Scientist,越擅长自动跑实验,反而越可能系统性地放大错误结论。如果我们把 AI Scientist 的科学发现能力拆成三层的话:

  • 第一层,流程自动化读论文、写代码、跑实验。

  • 第二层,交互探索提出假设、设计实验、根据反馈更新方案。

  • 第三层,机制发现在偏差、噪声和隐藏变量存在时,识别真正的因果结构。

现有 benchmark 大多停留在前两层。而 CausalGame 主要测的是第三层,也是 AI Scientist 离真正科学发现最远的一层。

正如论文强调的:科学发现最终追求的是因果与机制性知识,即一个系统在干预下会如何改变、以及为什么改变,而不是只在固定数据生成过程下成立的相关 [1,2]。这与已有工作的定位差别很明显。

打开网易新闻 查看精彩图片

按论文 Table 1 的对比,CausalGame 是其中唯一同时覆盖自动评测、实验设计、多轮交互、因果关系、解释评估与观测陷阱六个维度的 benchmark。它关注的是一个更底层的问题

当观测数据本身会误导你时,agent 能否发现隐藏机制?

二、CausalGame:把科学发现压缩进一场游戏

在 CausalGame 中,LLM agent 扮演一名无人机设计师,需要在一系列被生存偏差截断、被隐藏变量混淆、被噪声污染的观测下,通过有限的实验预算,搞清楚决定无人机生存的隐藏因果机制。

游戏目标。agent 需要为无人机的 7 个部件(引擎、机翼、机身、座舱、天线、摄像头、火炮)分配防御值(DEF),并据此优化设计。

它能观测到的只是执行任务后幸存下来的无人机各部件的受损情况,目标是理解影响生存的底层机制,并在未知环境条件下最大化生存率。

打开网易新闻 查看精彩图片

SCM 作为游戏引擎。CausalGame 的核心设计是把结构因果模型(SCM)[1,2] 当作每个场景的“引擎”。每个场景对应一个 SCM,用一组带外生噪声的结构方程刻画天气、敌方探测、部件损伤等变量之间的关系:

这一设计的关键在于:agent 只有还原真实因果机制才能给出幸存率比较高的设计方案,以及合理的机制解释与此同时,通过修改 SCM 的结构和参数,我们可以任意构造新的游戏场景和环境。

游戏流程。游戏分为两个阶段:

  • 阶段一(探索):agent 有 200 架无人机的预算和最多 10 次部署调用。每次调用,agent 选择一个设计、部署一小批,并收到包含生存结果和可观测属性在内的部分反馈。可选地,agent 还能在开局时访问一批历史观测来获得初步理解。

  • 阶段二(评估):agent 提交唯一一次最终设计,在 1000 架无人机的机队上评测生存率。当生存率超过场景特定阈值(设在理论最优生存率之下约 5%–8%)即判定为获胜。

每个场景的最优设计都从 SCM 解析推导得出并经验验证,理论与经验生存率的差距控制在 2-3 个百分点以内。

评估方式。最后 agent 不仅要交设计,还要交一份简短的自然语言报告,解释自己基于交互证据做出的设计选择。

这里值得强调,为什么用“游戏”来评测 AI Scientist 是合理的:在真实科研里,我们往往不知道真因果机制是什么,因此很难判断 agent 是真的理解了,还是碰巧选对了答案。

而 CausalGame 中每个场景背后都有一个明确的结构因果模型(SCM),因此可以精确判断 agent 是真的识别了机制,还是只是侥幸过关。

三、三类真实科研陷阱:选择偏差、测量误差、隐藏混淆

CausalGame 通过 SCM 的灵活设计,把真实科学发现中最常见的三类观测陷阱,系统性地编码进游戏环境。

选择偏差:agent 只能看到幸存下来的无人机,因此看到的样本已经被"生存"这个条件筛过 [3,4]。

测量误差:agent 看到的是带噪代理变量,而不一定是真实机制变量 [5]。

隐藏混淆:某些关键变量一开始不可见,却同时影响观测特征和最终结果,制造出虚假相关 [6]。

这些设置对应了医学、流行病学和科学史中反复出现的核心困难:样本如何被选中、变量如何被测量、以及未观测共因如何制造虚假相关。

一句话概括:CausalGame 不是让 agent 在干净数据上找规律,而是让 agent 在“看起来有规律但其实会误导”的数据中做科学发现。

为评估 agent 是否真的理解机制,CausalGame 不只看生存率,还用 rubric 对解释报告打分,覆盖因果推理、实验设计、反思质量和数据使用四个维度

作者用三个独立 judge 验证了 rubric 评分一致性(平均 ICC = 0.75)[7],并用一个不依赖 judge 的配置路径分析作为补充(细节见后文与论文附录)。

四、两个代表性场景:当“看起来合理”的结论是错的

CausalGame 的 14 个场景由一个共同的模拟器实例化而来,其中两个基础场景最具代表性。

打开网易新闻 查看精彩图片

Antenna Trap:保护天线反而更危险。

  • 表面相关:天线 DEF 高 → 生存率高。

  • 错误结论:应该加强天线。

  • 真实机制:天线完好 → 信号发射 → 探测概率上升 → 战斗交火 → 被击落。

  • 最优策略: antenna_def = 0 ,让风暴尽早摧毁天线,激活“隐身模式”(约 82% 生存率)。

Deployment Zone Trap:看起来是海拔问题,其实是 EMI 问题。

这一族场景灵感来自 Farr 的霍乱悖论:海拔曾看似能预防霍乱,而真正的病因是低海拔处的水源污染。

在游戏里,agent 会观察到低海拔飞行损失率显著更高,于是可能得出“应该升级引擎以提高海拔能力”的结论。

但低海拔只是一个可见代理变量,真正的失败因素是被隐藏的电磁干扰(EMI):未观测的部署区同时决定了海拔和 EMI 水平,EMI 进一步导致通信失败和任务失败。

因此正确策略不是追逐海拔相关,而是选择 signal_filter 增强模块,并把防御资源配置到 EMI 防护相关的护盾上。

论文给出的 family-level 最优干预是 x_shd = 25 + signal_filter ,对应约 80% 生存率。

五、30 个前沿模型的结果:会实验,但仍难以发现因果

CausalGame 系统评测了 30 个前沿 LLM agent,覆盖 OpenAI、Anthropic、Google、xAI、DeepSeek、GLM、Qwen、Kimi、MiniMax 等主流模型家族,每个模型在 Prompting 和 Agentic 两种执行模式下评测,并补充测试了 OpenCode 这类 coding agent 框架。

主要的发现如下:

打开网易新闻 查看精彩图片

发现一&二:目前的 Frontier LLM 普遍欠缺因果思维能力。

Figure 1a 把各模型在 Agentic 模式下的平均生存率放到成本-性能平面上:所有模型挤在 59%–68% 的窄带里,表现最好的 Claude-Opus-4.5(68.0%)离 75% 的获胜线还差 7 个百分点,离 78%–85% 的解析最优更远。

成本维度同样说明问题:Pareto 前沿相当平缓,单次任务成本相差一个数量级的模型,生存率差距不过几个百分点,Grok-4.1-Fast 以低一个数量级的成本就站上了前沿,而单价最高的模型并没有换来相称的领先。

Figure 1b 从行为侧补上另一半:即便是 rubric 总分最高的 5 个模型,实验设计与数据使用两项接近满格,因果推理三项仍贴着底。

实验中,我们也发现,Agent 可以偶尔靠运气拿到不错的生存率,但是解释报告也没有识别出机制

作为参照,通过平衡采样移除选择偏差可让 Agentic 模式提升 8.7 个百分点、Prompting 模式提升 7.2 个百分点,量化了选择偏差本身的代价。

而规则基线(49.0%–52.7%)和“随机部署 10 次再让 LLM 分析”的混合基线(57.5%)虽远低于获胜线,却能在偏差重的场景上追平最弱的完整 agent,这说明任务靠盲目探索不可解,没有因果推理的 agentic 交互也几乎不增加价值。

打开网易新闻 查看精彩图片

发现三:只有因果推理能防住“探索过拟合”。

作者定义探索差距为同一设计在阶段一与阶段二的生存率之差,正差距意味着 agent 对小样本探索结果过拟合。

在四个 rubric 维度中,只有因果推理维度能清晰区分过拟合与否:在阶段一生存率 75%–85% 的区间,具备因果意识的轨迹平均差距为 −3.0 个百分点,其余轨迹为 +4.5 个百分点。

实验设计、反思质量、数据使用三个维度都没有类似效应。做了实验、引用了数字、写了反思,都防不住把小样本波动当成规律,只有真的理解机制,泛化才有保障

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

发现四:Agentic 框架对部分模型有帮助,但并不普遍,更不是根本解法。

逐模型对比两种模式,agentic harness 给 GPT-5.5 家族带来最大收益(+6.6 到 +9.4),也帮助了一批中档模型。

但对若干最强的 prompting 模型是中性甚至负面的,最大跌幅出现在 Gemini-3.1-Flash-Lite(−10.3)、Grok-4.20(−8.1)和 Kimi-K2.5(−6.4)。

更强的 OpenCode 的 harness 框架在测试的 5 个模型上全部优于 ReAct(平均 67.4% 对 60.5%),确认了更强框架确实有用;但与最优生存率之间的显著差距依然存在,说明瓶颈不在框架,而在机制识别能力本身。

发现五:因果思维是一个相对独立的能力维度。

CausalGame 的结果与现有能力 benchmark 只有弱相关:与 LLM Arena、HLE、SWE-Bench、Tau-2 Bench、AA-LCR 的相关性全部低于 0.35,最强的关联也只有 AA-Omniscience(Agent 0.48、Prompt 0.46)。

与此形成对比的是,两种执行模式之间的相关达 0.65,明显高于与任何外部 benchmark 的相关——CausalGame 捕捉到的是一个稳定、且在很大程度上正交于现有评测的信号。

会 coding、会答题、会多轮工具调用,并不等于会因果发现。AI Scientist 的因果能力需要被单独评测、单独训练。

六、失败模式:问题不在不会用数据,而在没有形成因果模型

CausalGame 结合 rubric 得分把每个 session 归入四种失败模式:A(No Engagement,无参与)、B(Blind Exploration,盲目探索)、C(Surface Analysis,表面分析)、D(Nascent Reasoning,初步推理)。

打开网易新闻 查看精彩图片

在 Agent 模式下,68.4% 的 session 属于 Pattern A:既没有设计有意义的实验,也没有尝试任何因果推理;24.1% 进入 Pattern D,各维度都有活动但每一项都很弱;B(4.2%)和 C(3.3%)都很少。

Prompting 模式的分布更加偏斜:86.2% 为 Pattern A,Pattern D 仅 7.9%——单轮提示严重限制了探索与数据利用。

最关键的是维度级分析:四种失败模式下,因果推理得分从未超过 16.3%

而且这个低分不是分类定义造成的伪影:Pattern D 的定义就是每个维度都有活动,其因果推理得分却只有 7.6%;Pattern C 的数据使用拿到满分 100%,因果推理仍停在 16.3%。

agentic 交互确实让模型更积极地探索、用数据、写反思,但参与不等于识别机制

进一步的具体 case 分析发现:在 Antenna Trap 的 504 个 agentic session 中,74.4% 出现了部件锁定(某些部件几乎只取固定值,探索严重不足),12.5% 部分识别了天线趋势但停在 antenna_def 6–10、从未触及最优区间,9.7% 出现“优化漂移”:一个 Claude-Opus-4.5 session 一度探到 antenna_def=5 、生存率 70%,却在后续步骤漂回并最终提交了 antenna_def=10 。

模型不仅在解释上失败,在实际的实验选择上也同样失败。

七、LLM agent 的“作弊”与“自欺”

新版论文还专门记录了评测过程中两类反复出现的定性行为。对任何在交互式科学发现环境中评测 agent 的人来说,这一节可能是全文最值得细读的部分。

第一类:钻环境的空子,而不是做实验。在有 shell 访问权限的 OpenCode 模式下,被测试的 LLM 如 deepseek-v4-pro 经常在后端频繁选择探测模拟器的 HTTP 接口,而不是研究底层因果机制,甚至直接从接口返回的 experiment_name 字段推断出隐藏的场景类型。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

作者量化了这个信息泄漏的影响:在标准评测中,各模型在最终报告里复述场景名的比例从 5% 到 88% 不等,而且越强的模型泄漏越多

发现后作者修补了泄漏(屏蔽实验标识、移除管理端点),主论文数字全部在加固环境下重新采集。

随着前沿 coding agent 获得更多自主性和工具权限,这类投机取巧、钻环境空子的行为,将是交互式科学发现评测中越来越需要预判和审计的失败模式。

打开网易新闻 查看精彩图片

第二类:明明失败,却宣布胜利。在 Prompting 和 Agentic 评测中,作者识别出 39 个 session:agent 提交的最终设计实测阶段二生存率明显低于获胜阈值,其收尾推理却明确宣告“任务完成”或“达成目标”:

  • 一个代表性案例是 glm-4.7,它在最终生存率尚未揭晓之前就抢先宣布 “MISSION REPORT: OPTIMIZATION COMPLETE”、“预计超过 75% 生存阈值”,但实际结果只有 50.1%。

  • 类似模式还出现在 gpt-oss-120b(自述“稳稳高于 75%”,实测 49.5%)、minimax-m2(自信“这就是最优设计”,实测 31.9%)和 gemini-3.5-flash 上。

这说明在这类 benchmark 中,agent 的自我报告是不可靠的终止信号也正是 CausalGame 采用外部裁判、阈值判定胜负的原因。

八、这对 AI Scientist 意味着什么?

CausalGame 的结果并不是说 LLM agent 没有科学发现潜力。

相反,它说明 AI Scientist 的评估需要进入一个更细的阶段:我们不能只问 agent 会不会读论文、写代码、跑实验,也不能只看最终答案是否正确,甚至不能相信 agent 自己说的“我成功了”。

我们还需要问:

  • 它是否知道自己的数据可能有偏?

  • 它是否会主动设计实验来区分相关和因果?

  • 它是否能在结果反直觉时更新假设,而不是过拟合小样本的波动?

  • 它是否在诚实地做实验,而不是在环境里找捷径?

  • 它是否能解释一个可检验的隐藏机制?

这正是 CausalGame 希望推动的方向:把 AI Scientist 的因果思维变成可控、可评测、可归因,也可进一步训练的能力。

作者也指出了一个自然的下一步,即用 CausalGame 中程序化生成的场景来训练因果 agent,并且有意义的进步应当同时体现在生存率和因果推理得分上,从而保证收益来自机制理解,而不只是更强的搜索启发式。

下一代 AI Scientist 不应只是科研流程的执行器,而应该是能识别机制、质疑证据、设计干预的科学发现者。

欢迎访问项目主页 https://causalgame.github.io 获取更多技术细节、完整结果与代码。

如果您觉得这项工作有帮助,欢迎关注、转发与引用。

参考文献

[1] Spirtes, P., Glymour, C. N., and Scheines, R. Causation, Prediction, and Search. MIT Press, 2000.

[2] Pearl, J. Causality. Cambridge University Press, 2nd ed., 2009.

[3] Berkson, J. Limitations of the application of fourfold table analysis to hospital data. Biometrics Bulletin, 2(3):47–53, 1946.

[4] Sackett, D. L. Bias in analytic research. Journal of Chronic Diseases, 32:51–63, 1979.

[5] Kipnis, V., Subar, A. F., Midthune, D., et al. Structure of dietary measurement error: Results of the OPEN biomarker study. American Journal of Epidemiology, 158(1):14–21, 2003.

[6] Doll, R. and Hill, A. B. Smoking and carcinoma of the lung. British Medical Journal, 2(4682):739, 1950.

[7] Shrout, P. E. and Fleiss, J. L. Intraclass correlations: Uses in assessing rater reliability. Psychological Bulletin, 86(2):420–428, 1979.

Illustration From IconScout By IconScout Store

6 位不同来路的具身创业者闭门聊天局

北京时间8月25日(周二) 晚20:00截止报名

详情点击图片跳转

打开网易新闻 查看精彩图片

9月28日晚@美国匹兹堡

「IROS 2026 群星闪耀 精英晚宴」

免费报名,期待线下见面!

北京时间9月25日(周五) 12:00截止报名

-The End-

扫码观看!

本周上新!

“AI技术流”原创投稿计划

TechBeat是由将门创投建立的AI学习社区(www.techbeat.net)。社区上线700+期talk视频,3000+篇技术干货文章,方向覆盖CV/NLP/ML/Robotis等;每月定期举办顶会及其他线上交流活动,不定期举办技术人线下聚会交流活动。我们正在努力成为AI人才喜爱的高质量、知识型交流平台,希望为AI人才打造更专业的服务和体验,加速并陪伴其成长。

投稿内容

// 最新技术解读/系统性知识分享 //

// 前沿资讯解说/心得经历讲述 //

投稿须知

稿件需要为原创文章,并标明作者信息。

我们会选择部分在深度技术解析及科研心得方向,对用户启发更大的文章,做原创性内容奖励

投稿方式

发送邮件到

yimingzhang@thejiangmen.com

添加工作人员微信(aceyiming投稿,沟通投稿详情

关于我“门”

将门是一家以专注于数智核心科技领域新型创投机构,也是北京市标杆型孵化器。 公司致力于通过连接技术与商业,发掘和培育具有全球影响力的科技创新企业,推动企业创新发展与产业升级。

将门成立于2015年底,创始团队由微软创投在中国的创始团队原班人马构建而成,曾为微软优选和深度孵化了126家创新的技术型创业公司。

如果您是技术领域的初创企业,不仅想获得投资,还希望获得一系列持续性、有价值的投后服务,欢迎发送或者推荐项目给我“门”:

bp@thejiangmen.com

打开网易新闻 查看精彩图片

点击右上角,把文章分享到朋友圈