来源:市场资讯
(来源:BioAI Frontier)
—— 70 项预注册实验 × 469 个效应 × 12 万被试 × GPT-4 逐格模拟
论文遵循 Springer Nature 版权,插图均来自原文,引用请保留出处 (DOI: 10.1038/s41586-026-10742-x)
一句话核心
• 结论:让 GPT-4 逐一“扮演”具有不同人口特征的美国人、模拟他们对实验刺激的回答,再对比不同实验条件下的平均回答,推算出的“处理效应”与真实实验结果的相关系数高达 r = 0.85,与人类预测者(群体智慧)相当。
• 代价:一次“AI 预实验”成本不到 1 美元,却能顶替约 230 名真人被试(约 736 美元)。
• 警示:AI 系统性地“高估”效应量约一倍,只能作为辅助工具而非替代人类样本;还存在偏见与被滥用风险。
一、为什么这是一件大事
社会科学的核心方法是随机对照实验:给一组人一种刺激(比如某条劝导信息),另一组不给,再看两组的态度或行为差多少——这个差就是处理效应(treatment effect)。跑一个有统计效力的实验往往要几百上千名被试、几千甚至上百万美元,还要几个月。
那么问题来了:如果大语言模型(LLM)真能读懂人类,它能不能在实验开跑之前,就相当准确地预测出结果?如果能,预实验、样本量估计、干预方案筛选、判断哪些已发表结论需要重做验证……都可能以近乎零成本完成。
这篇 Nature 论文第一次用大规模、严格的证据回答了这个问题。作者搭建了两个“考卷档案库”:
① 主档案库 —— 70 项由美国国家科学基金会(NSF)资助的 TESS 项目及一项复现研究产出的全国代表性调查实验,含 469 个实验效应、119,330 名被试。关键是,其中很多研究在 GPT-4 训练数据截止(2021 年 9 月)之前尚未发表,可以真正检验模型预测新结果而非背答案的能力。
② 次档案库 —— 15 项“巨型研究”(megastudy),一次比较几十上百种干预,共 606 个效应、486 万名被试,还带有领域专家的预测作为对照。
二、用了什么技术、什么原理
▍ 1. 核心思路:把 LLM 当成“合成受试者”,逐格模拟
方法本身不依赖任何针对具体研究的建模,而是用一套统一的提示词(prompt)让模型扮演一个个具体的美国人。对每个实验条件 × 每个结果问题,喂给模型四样东西:
(1) 一句随机抽取的引导语(如“你将预测人们对不同信息的反应”);(2) 一个来自全国代表性样本、按人口基准抽取的虚拟被试画像(性别、年龄、种族、教育、意识形态、党派);(3) 实验刺激本身;(4) 结果问题及其打分量表。然后让模型以这个人的身份给出回答。
图1:方法全流程。上半部分对 70 项原始实验用统一口径(均值的百分点差)算出真实处理效应;下半部分把实验材料填进固定格式的 prompt,让 LLM 为各类人口画像模拟回答,再算出 LLM 版处理效应;两者对比,用 r / r_adj / RMSE / 回归斜率 b 四个指标评估。
▍ 2. “集成”降噪:120 条 prompt × 5 次采样再平均
单条 prompt、单次回答噪声很大。作者用了两层平均来逼近“群体”:每个条件生成 120 条 prompt(对应 120 个不同画像),每条 prompt 采样 5 次模型回答取平均得到该 prompt 的模拟值,再跨 120 条 prompt 做集成平均,以消除对某一种提示格式的特异反应。论文验证:用的 prompt 越多,相关性越高。
# 固定 prompt 模板(示意)
[引导语]
You are a [自由派/保守派], [年龄], [种族], [性别],
American with [教育程度], who identifies as [党派].
The first page of the survey says: [实验刺激文本].
The next page says: [结果问题].
Please choose a number from: [打分量表].You choose: __
▍ 3. 四把“尺子”:不只看相关,还看是否高估
为了公平评估,作者对每个实验随机选一个参照条件,算出所有两两对比的 LLM 预测效应,再和原始数据算出的真实效应做比较,重复 32 次取中位数。用四个指标衡量:
指标
含义与作用
r(原始相关)
预测效应与真实效应的相关系数,反映能否区分效应大小的排序。
r_adj(校正相关)
用两阶段随机效应元分析(metafor 包)扣除原始效应的抽样误差后的真实相关,小样本研究会被明显拉高。
RMSE_adj
预测值与真实值之间的平均误差(百分点),衡量绝对精度。
回归斜率 b
用真实效应对预测效应回归的斜率;b<1 说明模型高估,b>1 说明低估。
为检验模型是否只是“背诵”训练语料里的已发表结果,作者特意分层考察了截止日前未发表、2025 年 6 月仍未发表、以及“模型猜不出作者”的研究——若靠背答案,这些应更差,结果却依然很高,反驳了检索式作弊的质疑。
三、主档案库:GPT-4 追平人类预测者
在 469 个效应上,GPT-4 的预测与真实效应强相关:r = 0.85(校正后 r_adj = 0.92)。而且这种能力随模型代际稳步跃升——从 GPT-3(Davinci)的 r = 0.24,到 GPT-3.5 的 0.81,再到 GPT-4 的 0.85;开源模型 Gemma-3、GPT-OSS、DeepSeek v.3 也都达到 0.81~0.86,缓解了对闭源模型可复现性的担忧。
图2:主档案库结果。a,GPT-4 预测效应 vs 真实效应的散点(每点一个两两对比),r = 0.85。b,相关性随 LLM 代际提升,GPT-4 已追平人类预测者(0.89),二者结合可达 0.93。c,稳健性检验:在各学科子集、未发表研究(截止前 0.95、2025 仍未发表 0.97)、模型认不出作者等子集中,相关性依旧高。
三个关键发现:
• 追平人类:2,659 名美国普通人给出的众包预测相关性为 r = 0.84,GPT-4 与之统计上无差异(P = 0.118);而早代模型达不到。更有意思的是——人和 AI 提供的是部分独立的信息,把两者简单平均后相关性升到 r = 0.89,优于任何一方单独预测。目前人机协作精度最高。
• 不是背答案:对训练截止前未发表的 30 项研究(252 个效应),相关性反而更高(r = 0.90);到 2025 年 6 月仍未发表的 19 项(138 效应)达 r = 0.92。
• 但系统性高估:尽管排序很准,LLM 把效应量预测得约为真实值的两倍(b = 0.56),RMSE 高达 11 个百分点。有意思的是,人类预测者同样高估(b = 0.58)。所以要预测绝对大小,必须用基准数据重新校准(recalibrate)。
四、次档案库:巨型研究里追平专家
巨型研究更难预测——含非文本干预(如短视频)、真实行为结果(如打疫苗),且多针对稳定态度、效应本身很小。整体相关性降到 r = 0.39,但这恰恰和人类专家一样低:在 9 项带专家预测的巨型研究里,LLM(r = 0.34)与专家群体智慧(r = 0.26)统计上没差别(P = 0.30)。
图3:巨型研究结果。逐项巨型研究中 LLM 预测与真实效应的相关性,以及调查实验/实地实验/含专家预测三类的平均。LLM 的整体相关性至少不低于专家群体智慧,但同样系统性高估效应量。
拆开看:文本类干预(r = 0.45)优于非文本(r = 0.24),调查实验(r = 0.43)优于实地实验(r = 0.33)。这说明主、次档案库的差距主要来自题目难度构成不同,而非模型能力崩塌——把可比子集(稳定态度、小效应)对齐后,两库相关性相近。
五、能拿来干什么:三个已验证的落地场景
作者调查了 460 位社会科学家(教授、博后、研究生),他们最愿意用 AI 的场景排在前列的正是下面这几个;76.3% 的人表示至少有一个用途会超过 50% 的使用意愿。
图4:三大落地场景 + 使用意愿调查。a,预实验:纯 LLM 预测(每项<1 美元)误差≈230 名真人(约 736 美元);100 名真人+LLM≈385 名真人。b,预测复现:LLM 预测的效应越大,该结论越可能在大样本中复现成功。c,筛选干预:在专家判断中融入 LLM,选出的干预平均效应大 6%、最优干预大 8%。d,460 位学者的使用意愿,以效力分析、干预筛选、AI 预实验、识别需复现结论居前。
场景
做法与收益
AI 预实验
用模型模拟各条件回答估计效应;纯 LLM 成本<1 美元 ≈ 230 名真人;100 名真人 + LLM(约 320 美元)≈ 385 名真人(约 1,232 美元)。
找需复现的结论
把小样本里显著的效应交给模型打分:LLM 预测效应越大,越可能在大样本复现(每高 1 个百分点,复现成功几率 +25%);控制样本量、检验统计量后仍显著。
筛选有效干预
在 11 项带专家预测的巨型研究里,用专家 + LLM 平均值挑选干预,选中的方案平均效应大 6%,单选最优时大 8%。
六、别高兴太早:偏见与滥用风险
• 群体偏见:整体上各人口子群相关性都较高,但存在小而显著的差异——对白人优于黑人、对共和党人优于民主党人。不过作者坦承,本档案库里各群体真实效应本就高度同质(仅 7.7%/8.8%/18.3% 的效应被性别/种族/党派显著调节),不足以严格检验偏见,需要更异质的档案库。
• 可被滥用:模型现有的一阶护栏(拒绝直接写有害信息)挡不住从一堆选项里挑出最有害的那个。作者用真实反疫苗 Facebook 帖子数据验证:LLM 挑出的 5 条最能降低接种意愿的帖子,在原实验中确实使接种意愿下降 2.77 个百分点。为此他们呼吁二阶护栏,并在论文公开前已把该发现同步给主流 AI 公司相关部门。
• 更深的隐忧:模型低估人类回答的方差(影响 Cohen's d 等标准化效应量与功效分析)、闭源模型不透明难复现、以及过度依赖导致研究只挑好预测的题目做等认识论风险。
七、一句话总结与启示
技术速览一卡通
• 方法本质:无微调、无针对性优化,纯靠“固定 prompt + 人口画像 + 集成平均”,把通用 LLM 变成可批量模拟的合成受试者。
• 最强战绩:主档案库 r = 0.85(校正 0.92),追平人类;不是背答案(未发表研究反而更准);开源模型也能打。
• 最大短板:系统性高估效应量约一倍(人类专家也一样),预测绝对值必须校准;偏见与滥用风险真实存在。
• 正确姿势:“增强”而非“替代”——人 + AI 结合精度最高(r = 0.89);把它当低成本预实验、复现筛查、干预初选的辅助工具。
Large language models can predict the results of social science experiments · Ashwini Ashokkumar, Luke Hewitt, Isaias Ghezae, Robb Willer · Nature (2026) · DOI: 10.1038/s41586-026-10742-x · © The Author(s), Springer Nature Limited 2026
热门跟贴