你有没有想过这样一个问题:欧洲一些地区的鹳鸟数量越多,那里的人类出生率也越高。如果你训练一个模型来预测出生率,它会学到一条清清楚楚的规律,鹳鸟多,孩子也多。
那接下来的问题就有意思了。如果政府想提高出生率,是不是应该多进口一些鹳鸟?
这个例子出自研究者 Mooij 等人在 2016 年的讨论,它精准地戳中了一个所有做数据分析的人都该警惕的陷阱:预测得准,不等于知道"如果我改变某个东西,结果会怎样"。鹳鸟和出生率的相关性可能只是因为两者都跟"农村地区、传统家庭结构"这类隐藏因素有关,跟因果一点关系都没有。这就是那句老话说的,相关不是因果。
这篇论文要讲的,是如何用一种全新的方式,让机器学会分辨"真的有效"和"看起来有效"。
为什么这件事一直很难
在这篇论文之前,做因果推断是一件相当费劲的事情。
你得先研究数据,琢磨这些变量之间可能存在什么样的因果机制,然后从一个庞大的工具箱里挑一个合适的估计方法,可能是贝叶斯加性回归树,可能是双重机器学习,也可能是因果森林,接着调超参数、拿验证集反复试,最后才能在你的数据上训练出一个可用的模型。
问题是,换一个新问题,这一整套流程就得重来一遍。没有办法把上一次调好的模型直接搬过来用,每次都是从零开始。
这跟现在机器学习圈子里最火的另一种范式形成了鲜明对比。图像识别、自然语言处理这些领域早就转向了"地基模型"的打法:花大代价训练一个超大规模的网络,之后不管遇到什么新任务,直接拿来用就行,不用再训练。这篇论文要做的,就是把这套打法搬到因果推断的世界里来。
因果地基模型
因果地基模型(Causal Foundation Model,缩写CFM):一种提前训练好的神经网络,专门用来估计诸如平均处理效应这样的因果指标。它靠"上下文学习"在全新的数据集上直接做预测,不需要针对每个新任务重新训练。
这套模型的工作方式说起来其实挺反直觉的。你把一份带有处理变量和结果的表格数据喂给它,它不做任何梯度更新,不调整任何权重,直接就能告诉你这个处理措施的因果效应有多大。整个过程就是一次前向传播,跟以前那种"训练-调参-预测"的三段式彻底不一样。
想象一下你去看一个老中医,每次看新病人都得重新学一遍医术,望闻问切从头学起,这显然不现实。真正的老中医是见过成千上万种病例之后,练就了一种"一眼看出问题"的本事,新病人一来,他不需要重新学习,直接根据过往积累的经验做出判断。因果地基模型走的就是这条路,它在训练阶段"见过"海量的、由计算机模拟出来的因果场景,练就了一种通用的判断能力,遇到新数据时直接调用这种能力,不用再从头学。
如果不这样设计会怎样?答案就是回到最开始说的那种效率困境,每个新任务都要重新走一遍"提假设、选模型、调参数、训练"的完整流程,耗时耗力,还没法把之前积累的经验转移过来。
反事实的世界
要理解因果地基模型是怎么工作的,得先弄明白因果推断这个领域最核心的一个困境。
学界普遍采用的是内曼鲁宾潜在结果框架来描述这件事。假设有一个病人,医生可以选择给他用药或者不用药。这个病人如果用药会怎样,如果不用药又会怎样,这两种结果理论上都存在,学术上把它们叫做潜在结果。
潜在结果:假如对个体施加某种处理,理论上会出现的结果。比如某个病人如果服药,血压会降到多少,这是一个潜在结果;如果不服药,血压会是多少,这是另一个潜在结果。
麻烦的地方在于,一个病人在现实中要么吃药要么不吃药,你永远没法同时观察到两种结果。这在因果推断领域被称为"因果推断的根本问题":如果一个人实际接受了处理t并观察到结果y,你永远不可能知道如果他接受了另一种处理t',结果会是什么样。
这就好比你面前有两条岔路,你选了左边那条走下去,永远没法真的走一遍右边那条路来做对比。你只能靠已经走过左路的人和已经走过右路的人做类比,猜测如果换成右路会怎样。但这个类比能不能成立,取决于走左路的人和走右路的人本质上是不是差不多的人。
因为这种"没法两全"的限制,研究者们定义了几个统计量来间接刻画因果效应。最常用的是平均处理效应,简称ATE,它衡量的是把某种处理施加给整个人群,相比不施加,结果平均会变化多少。
平均处理效应(ATE):在整个人群上,接受处理相比不接受处理,结果的平均变化量。
如果只看ATE可能会掩盖掉一些细节,比如某种药对年轻人特别管用,对老年人几乎没效果,这种差异用ATE是看不出来的。所以还有一个更精细的指标叫条件平均处理效应,简称CATE,它是针对具有特定特征的一群人,计算处理效应会是多少。
条件平均处理效应(CATE):针对具有相同特征的一群人(比如同龄、同性别、同收入水平),施加处理相比不施加,结果平均会变化多少。这比ATE更细致,能揭示"对谁有效、对谁无效"的差异。
想象一个连锁药店想知道打折促销对销量的影响。ATE告诉你的是"平均来说打折能带来多少销量提升",但CATE能告诉你"打折对年轻消费者的效果比对老年消费者强得多"。如果只看ATE,可能会得出"打折略微有效"的笼统结论,实际上是年轻人反应剧烈、老年人几乎没反应,两者一平均就显得平淡无奇了。这种信息损失,正是CATE存在的意义。
什么条件下才能算出真相
光有潜在结果的概念还不够,你得知道在什么条件下,从观察到的数据里真的能算出因果效应,这个问题叫做"可识别性"。
可识别性:指某个因果量能不能仅凭观察数据(不需要真的做实验干预)就唯一确定下来。如果两个完全不同的底层机制会产生一模一样的观察数据,那从数据本身是无法判断真相是哪一个的,这时候因果效应就是不可识别的。
论文里提出了三个关键假设,合起来被称为"后门设定",满足这三个假设,因果效应才能从观察数据里被算出来。
第一个假设叫可忽略性,意思是说,在控制住已知特征之后,一个人接受什么处理跟他的潜在结果没有关系。用大白话讲就是,医生给病人开药的决定,不能是基于病人的病情严重程度之外的其他隐藏因素。第二个假设叫正性,要求每种处理在每种特征组合下都有可能被观察到,不能出现"这类人从来不可能接受这种处理"的情况,否则你压根没法从数据里学到这类人接受该处理会怎样。第三个假设叫稳定单元处理值假设,简称SUTVA,它要求一个人的结果不受其他人接受什么处理的影响,而且处理本身必须是定义清晰、没有歧义的。
这三个假设凑在一起,才能保证观察数据里蕴含的信息足以还原出真实的因果关系。这也是为什么论文反复强调,可忽略性这个假设是没法用数据本身来验证的,它得靠专业知识和常识去判断。
从贝叶斯的视角看这一切
传统的贝叶斯推断做法是,先假设一个关于数据生成过程的先验分布,然后用观察到的数据把这个先验分布更新成后验分布,最后用后验分布去计算你关心的因果量。
先验数据拟合网络:一种基于Transformer的模型,它能直接把一批标注好的数据映射成一个后验预测分布,不需要中间显式地去逼近后验分布本身。这种模型靠"上下文学习"来完成推断,输入的数据集本身就充当了推断的依据。
论文里详细拆解了这类模型能够运作起来的三个核心要素。
第一个要素是一种特殊的损失函数,叫先验数据损失。它巧妙的地方在于,你不需要知道真实的后验预测分布长什么样,只需要让模型在真实标签处给出的似然值尽可能高,这个损失函数在数学上等价于让模型输出去逼近真实的后验预测分布,理论上是站得住脚的。
第二个要素是可以无限生成的合成数据先验。因为真实世界里收集不到覆盖所有可能场景的训练数据,模型选择自己"编"数据来练手,每一批训练数据都是全新生成的,模型见过的场景永远不会重复。
第三个要素是Transformer架构带来的上下文学习能力。这让模型可以把整份数据集当作输入的一部分,通过注意力机制去关注这些数据,而不是把知识存进权重里。
这套逻辑放到因果推断里会遇到一个新麻烦。普通的预测任务里,模型看到的例子和它要预测的目标是同一种类型的数据,都是特征对应标签。但因果推断不一样,模型看到的是观察数据,也就是每个人只有一个处理和一个结果,它却要去预测反事实的、从没被观察到过的因果效应。这就好比让一个只吃过苹果的人去描述葡萄的味道,输入和输出之间存在着结构性的鸿沟,这也是为什么论文说因果地基模型面对的任务比普通的预测型模型要难得多。
三个先行者
论文里详细介绍了三个已经开源的因果地基模型,它们几乎是同时被提出来的,思路各有侧重。
Do-PFN由Robertson等人在2025年提出,它瞄准的是条件干预分布,直接预测在某种干预下结果会是什么分布。它的先验设计比较特殊,允许生成不可识别的场景,也就是说同一份观察数据背后可能对应着多个不同的真实因果机制。这个设计的用意是让模型学会在遇到无法识别的情况时,主动表现出更大的不确定性,而不是硬给出一个可能错误的答案。
CausalPFN由Balazadeh等人在2025年提出,它盯的是条件期望潜在结果,也就是给定特征和处理,结果的期望值是多少。它的先验设计遵循严格的后门设定,也就是只在满足强可忽略性和SUTVA的场景里训练。正是这种"专攻可识别场景"的策略,让CausalPFN在需要满足后门假设的评测里表现得格外出色。
CausalFM由Ma等人在2026年提出,它瞄准的是条件处理效应分布,并且野心更大一些,专门训练了三套模型分别覆盖后门、工具变量和前门这三种不同的因果设定。这个团队还从理论上证明了一件事,如果先验里包含了不可识别的场景,那不管给模型喂多少数据,它都没法收敛到真实的因果效应,这为"要不要用可识别先验"这个设计选择提供了扎实的理论支撑。
这三个模型的架构选择也各有巧思。Do-PFN和CausalPFN都选择把处理变量放在数据表格的第一列,让模型通过位置来学习它的特殊地位。CausalFM则更进一步,把协变量、处理变量、结果变量分别用不同的编码器处理之后再拼接起来送进Transformer。这些细节上的差异,某种程度上反映了各自团队对"处理变量该被特殊对待到什么程度"这个问题的不同理解。
拿真实数据练兵的结果
光讲原理不够,这篇论文一个重要贡献是拿一份叫RealCause-Lalonde的半合成基准数据集,把这三个因果地基模型跟一批经过精心调优的传统方法放在一起比了一场。
这份数据集来源于著名的Lalonde就业培训项目研究,通过拟合生成模型,既保留了真实世界数据的复杂性,又能保证生成的结果满足可忽略性假设,这样才有一个"标准答案"可以拿来核对。
比较结果挺有意思的。CausalPFN的表现相当抢眼,在个体效应估计的精度指标上排名第一或接近第一,跟经过大量调参的T-Learner基线不相上下,甚至在部分数据集上超过了它。反倒是IPW这种专门为估计群体平均效应设计的传统方法,在平均处理效应的相对误差上表现最好,但它没法给出个体层面的预测。
但更让人意外的是速度差距。所有的传统方法都需要经过完整的训练加调参流程,中位耗时基本都在半小时到四十五分钟之间,最长的X-Learner要跑上四十五分钟。而三个因果地基模型全都是直接推理,最快的CausalPFN在CPU上只需要十八点四秒。这中间差了大概一百倍的速度。
这就好比你请一个专业翻译临时给你翻译一份从没见过的合同,他得先花时间理解行业术语、熟悉语境,才能动笔。而一个已经在几十万份合同里练过手的资深翻译,看一眼就能直接下笔。前期的功夫都在见过世面的过程中做完了,真正用的时候只需要"看一眼"。如果没有这种预训练带来的摊销效应,每次都得走完整流程,一百倍的速度差距根本不可能出现。
不过这场比试也暴露了一个问题。Do-PFN和CausalFM在平均处理效应的相对误差上表现明显偏弱,两者的误差都接近1,也就是几乎没能捕捉到真实的处理效应大小,预测结果系统性地向零收缩了。这说明不同的预测目标对模型性能的影响很大,专攻CEPO的CausalPFN在这个特定场景下明显占优。
这个发现挺重要的,它提醒我们地基模型不是万能钥匙,选对预测目标和先验设定,跟选对底层架构一样关键。
正在生长的枝丫
这三个先驱模型确立了基本范式之后,研究社区很快就往外扩展出了不少分支。
有团队开始琢磨怎么让模型利用额外的先验知识。比如Reuter等人在2026年提出的方法,允许分析者告诉模型"我知道X1导致X2"这种部分因果结构信息,实验显示这种额外知识能带来明显的性能提升。这就好比一个侦探破案时,如果有人提前告诉他"凶手一定是这三个嫌疑人之一",破案速度和准确率自然会大幅提升,不需要再从零排查所有可能性。
也有团队把处理场景从二元处理拓展到连续处理,比如价格或者利率这种可以取任意数值的干预变量,这需要重新设计模型输出,让它能画出一整条"处理响应曲线",而不只是给出两个数字的差值。还有团队专门针对带时间维度的纵向数据设计了新的模型,用来处理医疗随访这类场景里处理会随时间变化、混杂因素也会随时间演变的复杂情况。
另一条值得关注的支线是部分识别和敏感性分析。有些场景下因果效应根本没法被精确算出来,只能给出一个区间。IV-ICL这个模型专门处理存在隐藏混杂因素的工具变量场景,它不强行给出一个点估计,而是给出一个可信的效应范围,这种"知道自己不知道什么"的能力,某种程度上比强行给出一个可能错误的精确数字要诚实得多。
还有研究者开始审视这些模型的可靠性问题。Melnychuk等人发现,部分现有模型存在一种源自先验设计的系统性偏差,这个偏差跟先验里混杂程度普遍偏低有关,他们还提出了一种后验校正的方法来消除这种偏差。这提醒我们,即便是号称"训练一次到处能用"的地基模型,也不是拿来就绝对可信的,背后先验的质量直接决定了模型的可靠边界。
因果地基模型的思路还外溢到了因果关系图谱的自动发现,也就是从数据里直接推断出变量之间谁是谁的原因这个更基础的任务。像Arrow、TabCausal这些模型,走的也是先在海量合成图谱上预训练、再零样本泛化到新数据的路子。这套思路甚至延伸到了生物学的单细胞扰动建模和医学里的生存分析等具体科学领域,说明这种"用合成数据预训练、靠上下文学习推断"的范式具有相当强的普适性。
写在后面
读完这篇论文,最触动我的一点是研究者们对"可识别性"这件事的执着较真。CausalFM的作者专门证明了一条定理:如果先验支持不可识别的场景,模型再怎么喂数据都学不到真实因果效应。这不是一句空泛的警示,而是一条经过严格数学证明的硬约束,它意味着因果地基模型的能力上限不是靠堆算力就能突破的,而是被先验设计的合理性框死了。这跟我们平时理解的"数据越多模型越强"直觉不太一样,在因果推断这个领域,数据量解决不了识别性的问题,必须靠假设和先验设计来解决。
另外一个值得琢磨的细节是那个鹳鸟出生率的例子。论文用这个例子开场,其实是在提醒每一个使用因果地基模型的人:这些模型再厉害,也只是在帮你更快地做统计推断,它没法替你判断你的假设是否成立。如果你喂给模型的数据本身违反了可忽略性假设,存在隐藏的混杂因素,那模型给出的答案再快再准,也可能是另一个版本的"进口鹳鸟提高出生率"。速度的提升不能替代对数据本质的理解,这可能是整篇论文技术细节之外,最值得记住的一句话。
如果因果地基模型真的能像预测型地基模型那样统一到一个通用架构里,同时支持多种处理形式、多种识别假设、多种因果目标,那会不会有一天,普通的业务分析师不再需要理解可忽略性、正性这些晦涩的假设,只需要把数据丢进去,模型自己就能告诉你"这个假设站不站得住脚"?这大概是这个领域接下来最值得追问的方向。
Q&A
Q1:因果地基模型和传统的因果推断方法有什么区别?
A:传统方法每遇到一个新问题都要重新分析数据、选模型、调参、训练,流程繁琐且无法复用。因果地基模型是提前训练好的神经网络,遇到新数据集时直接用上下文学习做预测,不需要重新训练,速度能快上百倍,同时准确率也很有竞争力。
Q2:目前有哪些开源的因果地基模型可以使用?
A:论文里提到了三个已开源的模型,分别是Do-PFN、CausalPFN和CausalFM,它们分别预测不同的因果量,比如条件干预分布、条件期望潜在结果、条件处理效应分布,在实测中CausalPFN在多数指标上表现最好。
Q3:因果地基模型的预测结果可靠吗?
A:整体上比较可靠,在真实数据基准测试中表现接近甚至超过精心调优的传统方法,但也存在局限,比如部分模型在估计平均处理效应时会出现系统性偏差,研究者建议结合具体任务谨慎选择模型并关注其先验设计是否符合可识别性假设。
热门跟贴