牛顿说过一句很有名的话:我能算出天体的运行轨迹,但算不出人性的疯狂。
这句话放在三百年后的今天,忽然有了一种新的现实意义。因为一群研究者正在尝试做一件牛顿绝对想不到的事情:不是去算人性,而是造一个能装下人性的世界,让这个世界自己运转起来,自己生出经济现象。
这就是这篇论文要讲的东西,经济世界模型。
先说清楚一件事,经济学一直以来的研究方式是什么样的。经济学家观察数据,收集证据,估计参数,建立模型,然后问一句话,是什么导致了什么。这套方法用了几百年,非常强大,但它有个先天的局限。
你算出了一个均衡点,你拟合出了一组参数,你预测出了一个转折点,这些都不等于你解释了这个经济现象。真正的解释,应该是这个结果能从模型内部自己生长出来,而不是研究者从外面硬套进去的。
这篇论文提出的核心想法就是,要理解一个经济体,不能只观察它的结果,得造一个能生成这些结果的世界模拟器。
物理世界和经济世界的根本差异
这里有个特别关键的区分,物理世界和经济世界是两种完全不同的系统。
物理世界的状态转移由外部规律决定,苹果从树上掉下来,不管这个苹果相信什么、期待什么,它都会按照万有引力定律往下落。
经济世界完全不是这样。家庭、企业、银行、监管者,他们观察信息,形成预期,做出决策,通过市场和制度相互作用。他们的集体行为产生了下一个经济状态,而这个新状态又反过来重塑他们未来的信念和行动。
**这个差异决定了经济世界模型和物理世界模型不能用同一套逻辑来建。**
打个比方,你用物理定律模拟台球桌上的球怎么碰撞,球不会因为知道自己要被撞而提前躲开。但如果你模拟股市里的交易者,他们会因为预期到价格要涨而提前买入,这个预期本身就改变了结果。这就是为什么经济世界模型必须把主体的信念、预期、策略调整都塞进状态转移的方程里,物理世界模型完全不需要考虑这些。
> 经济世界模型(Economic World Model,简称EWM):一种生成式的经济环境引擎,它通过建模经济体内部的主体如何观察、推理、行动、互动、适应经济制度和约束,来预测经济如何演变。
论文里给出了一个特别精炼的对比表格,物理世界靠的是外部规律,经济世界靠的是信念和激励,物理世界的主体是被动的物体,经济世界的主体是有策略的决策者,物理世界的规则是固定的,经济世界的制度会演化。这四对差异构成了整篇论文的出发点。
主体和世界模型是同一枚硬币的两面
论文里有一个很妙的说法,经济主体和经济世界模型是同一件事的两个视角,一个是微观视角,一个是宏观视角。
> 经济主体(Economic Agent):给定当前经济状态,观察信息、形成信念、面对约束,然后选择一个经济上可行的行动,用数学语言写就是 a_t = π(s_t)。
一个主体只回答一个问题,我这个个体接下来该怎么做。而经济世界模型回答的是另一个问题,整个经济接下来会变成什么样,给定当前状态和外部干预,映射到下一个状态,s_t+1 = T(s_t, u_t)。
这两者的关系很像天气预报员和飞行员的关系。飞行员只需要决定这一趟航班怎么飞,油门多大、航向多少,这是主体级别的决策。而天气预报员要预测整片天空接下来会怎样变化,云层怎么移动、气压怎么分布,这是系统级别的预测。**但经济世界的特殊之处在于,飞行员的决定会反过来改变天气**,因为经济里的主体不是被动接受环境的乘客,他们的集体行动本身就在塑造下一刻的经济环境。这在气象学里是不存在的,飞机再怎么飞也不会改变明天的风向,但在经济学里,投资者的集体买入本身就会推高价格。
论文提出,一个真正完整的经济智能系统,应该是从孤立的经济主体走向真正的能动经济体。孤立的主体只做单向的下一步动作预测,缺的是一个可执行的经济反馈循环,让这个动作的后果被实现、被评估、被作为学习信号返回。而能动经济体把这个单向预测问题,变成了一个工程化的闭环,主体侧的下一步动作预测和世界侧的下一个状态预测互相咬合。
论文里画了一个特别形象的循环图,经济主体在世界模型里学习,世界模型也从经济主体那里改进。主体提出候选行动,在世界模型里模拟后果,评估经济反馈,更新自己,这是一个循环。反过来,更好的主体能力会转移到世界模型里的主体身上,改进下一步动作预测的准确性,进而带来更准确的下一状态预测,形成更好的训练环境。这样一圈一圈转下去,就是主体和世界的共同进化。
如果没有这个闭环会怎样?那就退回到传统的孤立建模,主体在真空里做决策,永远不知道自己的行动在真实经济环境里会激起什么样的连锁反应,也没有机会从这些后果里学习。这就像一个刚学开车的人只在驾校的静止模拟器里练习方向盘操作,从来没有体验过真实路况里其他车辆对自己驾驶行为的反应,等真正上路遇到复杂交通流的时候,之前练的东西根本不够用。
把经济世界拆成可以编程的四层
这篇论文最实用的部分,是把经济世界模型从一个抽象概念变成了一套可以真正写代码实现的系统架构。整个运行时被拆成四层。
第一层是主体层,负责实例化各种各样的经济角色,家庭、企业、银行,每个角色都有自己的目标、信息、约束、记忆、工具和可行动作集合。
第二层是环境层,负责编码经济状态、市场机制、合约、会计恒等式和制度规则。
第三层是共同演化层,让主体、策略、机制、制度能在反复的模拟运行中不断适应。
第四层是现实对齐层,把模拟出来的轨迹和真实世界的观测数据做比较,纠正模型的偏差。
> 状态(State):在经济世界模型里,状态不只是价格、利率这样的宏观数字,而是一个包含三部分的复合结构,宏观经济状态(价格、产量、利率等)、每个主体的私人状态和信念状态(现金、库存、对未来的预期)、以及制度环境(规则、市场机制、政策)。
这个三层状态结构其实很好理解。想象你在管理一家公司,你不能只看财务报表上的总营收数字,你还得知道每个部门经理心里在想什么,他们对下个季度的预期是乐观还是悲观,同时你还得清楚公司现在受哪些制度约束,比如预算审批流程、合规要求。经济世界模型里的状态设计,就是把这三种信息都塞进同一个数据结构里,缺了任何一块,这个世界都转不起来。
论文用一组方程描述了状态如何一步步转移。先是每个主体根据先前的信念、自身状态、宏观环境和制度约束,更新自己的信念,这一步叫信念更新。接着基于更新后的信念,主体选出下一步动作,这叫下一步动作预测。然后每个主体的私有状态根据刚做的动作发生变化,比如现金减少了、库存增加了。再往后,所有主体的动作和状态被聚合起来,生成下一期的宏观经济状态,这一步叫下一状态预测,也是最关键的一步,因为价格、失业率这些宏观指标就是在这一步从个体行为里"涌现"出来的。最后一步,制度和规则本身根据这一轮的结果发生演化。
这五步串起来,就是一个完整的经济世界心跳周期。
论文还给出了一段极简的伪代码,用来说明这套系统在实际编程层面是怎么运作的。你构造一个叫做FXMarket的外汇市场世界,里面放进一千个家庭主体、二十个企业主体、五个银行主体,然后重置世界得到初始状态,接着循环若干轮,每一轮先让所有主体并行地观察状态、给出动作,再用这些动作推进世界到下一个状态,如此往复。
这段代码读起来像是在玩一个开放世界游戏的引擎接口,你构建地图、放入NPC、设定初始条件,然后让游戏引擎一轮一轮地推进。区别在于,这个游戏里的NPC不是按脚本行动的,他们的每一次决策都真实地改写了地图本身的样貌,价格会变、库存会变、制度规则甚至也会跟着变。
好的经济世界模型必须满足的四条硬标准
论文提出了四条工程上的硬性要求,任何想被称为经济世界模型的系统都得往这四条上靠。
第一条叫内生闭合,价格、分配、宏观状况这些结果,必须是从主体之间的分散互动里自己长出来的,不能是外部硬塞进去的。这一点很重要,因为这些结果不只是描述当前经济状态,它们还会反过来影响主体接下来的决策。如果把它们当作外生给定的,模型就失去了表达经济自我演化过程的能力。
第二条叫行为真实性,主体的行为应该反映真实经济角色感知信息、回应激励、面对约束时的样子。这里论文特别提到一个值得警惕的问题,大语言模型作为经济主体的时候,会表现出系统性的行为偏差,在某些偏好类任务上会犯人类式的认知偏差,在某些信念类任务上反而表现得更理性。这说明用大语言模型扮演经济主体,不能光靠给它写个人设提示词就完事,还需要专门的行为校验。
第三条叫演化动态,主体和经济的治理规则应该随时间共同演化,策略会调整,信念会转变,主体甚至可能通过经验获得新的认知能力,制度条件也会内生地演化。
第四条叫现实对齐,模型不应该只是生成看起来合理的模拟结果,还应该反复和新观测到的真实结果做比较,据此更新内部动力学,逐步缩小模拟经济和真实经济之间的差距。
**这四条标准里,前两条决定了这个世界像不像真的,后两条决定了这个世界能不能持续变得更像真的。**
六级能力阶梯,量出了整个领域现在站在哪里
论文最具冲击力的部分,是它系统梳理了七千八百三十六篇候选论文,最终确认七百三十七篇真正符合经济世界模型定义的文献,并把它们按能力强弱分成了六个层级。
第一级叫固定规则主体世界。这一级里主体和环境都遵循预先设定好的固定规则,价格、库存这些经济结果是主体互动内生产生的,但主体不会在运行中调整自己的决策方式。
第二级叫适应性规则主体世界。主体开始能根据交互历史和已实现的结果,修改自己的决策规则,用的是强化学习、进化搜索这类符号化或算法化的适应机制,但主体还没有形成丰富的信念表征。
第三级叫大语言模型自主主体世界。主体配备了显式的认知状态,包括信念、预期、记忆,能用语言推理、交流、做出情境敏感的经济决策,但这个认知能力本身在模拟运行过程中是固定不变的。
第四级叫自我演化主体世界。主体不只是调整信念和动作,还能在模拟中真正积累新的策略、技能、工具、行为程式,这些能力会持续存在并塑造后续的决策。
第五级叫制度演化经济世界。适应从主体扩展到了游戏规则本身,政策、市场规则、合约、治理结构会根据主体行为和总体结果发生改变。
第六级叫仿真到现实经济双胞胎。系统维护一个在线的纠错循环,把模拟轨迹和新观测到的真实经济数据做比较,出现偏差就更新相关组件。
**这六级不是简单的技术难度递增,而是经济世界从死的规则集,进化到活的、能自我调整的系统所需要跨越的几道门。**
论文的文献统计结果相当震撼。这七百三十七篇论文里,大多数都堆积在第一到第三级,尤其是二〇二四到二〇二五年,第三级论文数量出现了一次明显的爆发式增长。**但第四到第六级的论文数量少得可怜,几乎可以说是稀疏地带。**第六级的论文经过严格筛选,全世界范围内只找到两篇真正满足条件的工作,一篇是二〇一〇年用真实纳斯达克数据反推交易者行为参数的研究,一篇是二〇二五年提出的自适应主体建模校准框架,两者相隔十五年。
这个数字对比揭示了一个很有意思的现象,整个领域这些年疯狂涌入的智力和算力,几乎全部投向了让主体变得更聪明,却很少有人认真处理让整个世界的制度活起来、让模拟结果和真实世界形成持续对话这两件事。
这有点像盖房子的时候,所有人都在争先恐后地把每个房间装修得越来越豪华,却没什么人关心整栋楼的地基和水电系统有没有跟真实的城市供电网络对接好。装修再华丽,如果水电系统始终是自己内部循环,不接外部电网,这栋楼本质上还是个孤立的模型屋,住不进真实的人。
五种工程浪潮,一步步把经济世界模型推向可能
论文用了很长的篇幅,从工程史的角度回顾了通往经济世界模型这条路是怎么一步步铺出来的,一共分五波浪潮。
第一波是特征工程,核心是把经济学直觉转化成有信息量的数字信号,再用机器学习模型去预测资产回报、信用风险这类经济结果。
第二波是数据工程,随着大数据和深度学习兴起,重点从手工设计的特征转向大规模数据的收集、清洗、预训练。这一波诞生了像BloombergGPT这样在五百亿参数规模上专门针对金融文本训练的大模型,还有FinBERT、FinGPT这些专门服务金融领域的开源框架。
第三波是提示工程,大语言模型出现之后,不用重新训练模型,只要精心设计输入指令就能激发出复杂的经济推理。有研究显示,用角色扮演式提示词引导GPT-4o做宏观经济预测,准确率能达到接近人类专家小组的水平,这一点相当出人意料,毕竟这套方法完全不涉及模型参数的调整,靠的纯粹是提示词的巧妙设计。
第四波是上下文工程,超越了单纯的提示词设计,转向给大语言模型配备更丰富的运行时环境,包括检索增强、长上下文输入、结构化记忆、工具调用。
> 检索增强生成(Retrieval-Augmented Generation,简称RAG):让语言模型在生成回答之前先去外部知识库里检索相关信息,再结合检索到的内容进行推理,这样能大幅提升回答的时效性和准确性。
这一波里有个很有代表性的系统叫FinMem,给交易主体装上了分层记忆结构,短期记忆管当下的行情波动,长期记忆管更宏观的市场规律,这种设计让主体在长时间跨度的交易决策上表现得更稳健。
第五波是环境工程,也是最关键的一波,因为这一波的对象不再是主体本身,而是经济体这个整体。ABIDES这样的高保真离散事件金融市场模拟系统,把交易所协议、延迟、订单簿机制都做了精细建模,AI Economist和TaxAI则把税收政策制定本身变成了一个多主体强化学习问题。
**这五波浪潮串起来看,你会发现一条清晰的脉络,从关注单个信号,到关注海量数据,到关注怎么问对问题,到关注怎么给主体配齐装备,最后落到怎么把整个世界本身设计成一个可运行的系统。**
这就像盖一座城市,早期你只关心每一栋建筑的地基牢不牢,后来你开始关心整座城市的供水供电系统,再后来你开始设计城市里的交通规则和市民之间怎么打交道,最后你终于开始思考,这座城市本身的市政管理架构应该是什么样的,它能不能随着城市发展自己调整规则。经济世界模型工程,就是这最后一步。
三种落地场景,让抽象的世界模型变得可用
论文划分了三种应用场景,让这套系统真正落地。
第一种是给人类决策者用的沙盒。政策制定者可以在这个虚拟经济里先试验税收改革、产业政策,观察家庭、企业、金融机构会怎么反应,提前发现意外的副作用和分配效应。金融领域的人可以研究流动性枯竭、去杠杆化的螺旋效应、火线抛售的外部性,企业管理者可以在里面测试定价策略、供应链决策。
第二种是给大语言模型主体用的工具。主体在真正采取行动之前,可以先查询这个世界模型,比较不同动作的下游后果,这对交易主体估计市场冲击、采购主体评估供应链中断风险特别有用。这一层还承担着安全测试的角色,测试自主主体在部署之前会不会出现串谋、操纵、有害均衡这类系统性风险。
第三种是给大语言模型训练用的强化学习环境。经济世界模型能提供状态、动作、转移动力学和长短期奖励信号,让主体学会定价、交易、库存控制这些任务的策略,这一层里论文提到了一个具体案例,AlphaPortfolio用深度强化学习训练投资主体,考虑交易成本和状态交互,直接优化经济目标。
如果没有这样一个统一的三层应用框架,会发生什么?很可能是每个应用场景各自为战,政策模拟系统、企业沙盒、大语言模型的训练环境,各自独立开发一套逻辑,重复造轮子还互相不通用。这套三层框架的价值就在于,它把这些看起来风马牛不相及的应用场景,统一到了同一套经济世界模型底座上,就像不同的应用软件都可以跑在同一个操作系统上,而不需要每个软件商自己去写一套操作系统。
经济世界模型和相邻领域的边界在哪里
论文很谨慎地把经济世界模型和几个邻近的研究传统做了对比,避免过度拔高。
跟传统经济学模型比,纳什均衡和阿罗德布鲁一般均衡这些经典理论,靠均衡和理性预期来实现系统闭合,代价是假设完美理性、完全信息、瞬时清算,异质性和有限理性被排除在外。经济世界模型试图保留这种一致性追求,但通过显式的系统组件来实现,家庭、企业、银行各自独立,状态对象把结构化变量和语言化记忆配对,信念变成了可观察的中间产物。
跟基于主体的建模比,两者共享很多特征,包括主体异质性、明确的市场互动、涌现的宏观规律。**区别在于主体如何做决策,传统的基于主体建模里,主体通常按预定义规则行动,比如门限值、启发式规则,行为的边界就是建模者能用数学写出来的东西,而定性判断、情境化理解很难直接表达。**
跟大语言模型社会模拟器比,二者都聚焦语言中介的认知、深度异质性、把文本观测作为一等信息源,但设计重点不同。社会模拟器的目标是态度和行为层面的东西,观点转变、对话动态、扩散效应,周围的世界更像一个舞台而不是一个封闭的经济体,价格和分配很少来自真正的市场清算。经济世界模型把这个缺失的经济实质补上,环境本身就是一个真正的清算系统。
跟通用意义上的世界模型比,从Ha和Schmidhuber提出的先训练一个世界模型再在里面训练主体的架构,到DreamerV3在一百五十多个控制任务上取得的成绩,经济世界模型继承的是这套雄心,时间演化的动力学、学习而非手写的组件、可用于训练下游主体的环境。**但它抛弃了这个传统里的架构模板,因为大多数有影响力的世界模型都是围绕单一具身主体设计的,感知高维感官流,把状态压缩成一个隐向量。多主体的策略互动、内生的价格形成、受规则约束的制度结构,都在这些系统的工程范围之外。**
这条路还有哪些坎没迈过去
论文最后没有回避困难,坦率列出了几个悬而未决的问题。
行为真实性怎么校验,是第一个坎。主体不能只是产生听起来合理的叙述或理性选择,得真的反映真实主体感知信息、形成信念、回应激励的方式,这需要针对模拟主体和真实行为数据做持续的对齐和纠错。
经济闭合怎么做到既有经济学纪律又能算得动,是第二个坎。聚合过程是非线性的,策略互动、市场清算、网络溢出、瓶颈效应,都可能放大或抑制微观层面的行为,转移机制既要经济上严谨又要计算上可扩展,这两者常常互相拉扯。
共同演化怎么控制不失控,是第三个坎。主体学习新套路、修订策略,规则也会跟着政策、监管、合约的变化调整,但什么时候该演化、演化多快、怎么防止模拟演化滑向不真实或不稳定的动态,都是开放问题。
计算和工程规模化怎么办,是第四个坎。异质主体的互动、长时间跨度的滚动、内生市场机制、对真实数据的校准,这些都会随主体数量、时间步长的增加而快速吃掉算力,怎么在不牺牲真实性和验证质量的前提下把规模做大,是纯粹的工程难题。
世界级评估怎么做,是第五个坎。反事实的世界没有唯一的真实轨迹可以对照,需要同时在主体层面和世界层面做评估,主体是否复现了合理的信念和选择模式,世界是否生成了合理的价格、分布、危机动态。
经济有效性和均衡纪律怎么接上,是最后一个也是最根本的坎。一个经济世界模型系统可能有很精巧的主体、演化的规则、很强的经验对齐,但如果学习到的环境本身用错了地方,行为改变了用于重新训练的数据,这个系统在评估反事实的时候仍然可能是错的。**这一点论文特别强调,这套系统架构本身不能保证反事实一致性,真正的经济有效性判定,需要论文所依托的另一个理论框架,也就是数据驱动生成均衡理论,来提供不动点纪律。**
写在后面
读完这篇论文最让我停下来想很久的,是那个第六级只找到两篇论文的数字。
七千八百多篇候选文献,最后能称得上"活的经济双胞胎"的,全世界只有两个,还相隔十五年。这不是因为没人想做,而是因为这件事真的太难。让一个模拟系统持续吸收真实世界的新数据,不是重新拟合一次参数就完事,而是要让这些真实观测持续渗透进正在运行的模拟本身,改写主体正在形成的信念、正在演化的制度动态。
这让我想到一个问题,我们现在对大语言模型主体的期待,是不是也犯了同样的错。大家兴奋地看着主体越来越会说话、越来越会推理,却很少有人问,这个主体所处的那个世界,它本身有没有在跟着真实世界一起呼吸。一个再聪明的主体,如果它生活在一个永远不更新的假想经济体里,它的聪明能有多大的现实价值?
这篇论文没有给出答案,它只是很诚实地把这道题摆在了桌面上。
Q&A
Q1:经济世界模型是什么?
A:经济世界模型是一种生成式的经济环境引擎,它通过建模经济体内部的家庭、企业、银行等异质主体如何观察信息、形成信念、做出决策、相互互动,来生成经济状态的演变,而不是像传统经济学那样从外部预先设定结果。
Q2:经济世界模型和传统的经济学模型有什么区别?
A:传统经济学模型比如一般均衡模型,靠理性预期和均衡来保证系统的一致性,通常假设完美理性和完全信息。经济世界模型保留了对一致性的追求,但通过让主体拥有真实的信念状态、语言化的记忆和可观察的推理过程来实现,能容纳异质性和有限理性。
Q3:目前经济世界模型的研究进展到什么程度了?
A:论文系统梳理了七千八百多篇相关文献,最终确认七百三十七篇符合定义。研究主要集中在让主体变得更聪明的低层级阶段,而涉及制度自我演化和与真实世界持续对齐的高层级系统非常稀少,全世界目前只有两篇论文真正做到了持续的仿真到现实对齐。
热门跟贴