物理AI智能体的主动推理
https://arxiv.org/pdf/2603.20927
摘要
物理人工智能体,例如在紧张且波动的资源约束下运行的机器人和其他具身系统,在开放式的真实世界环境中,其能力仍远不如生物智能体。本文认为,植根于自由能原理的主动推理(AIF),为弥合这一差距提供了一个有原则的基础。我们从第一性原理出发发展这一论点,遵循一条从概率论到贝叶斯机器学习、再到变分推理、直至主动推理和反应式消息传递的链条。从自由能原理(FEP)的视角来看,那些随着时间推移保持其结构和功能完整性的系统,在适当的假设下,可以被描述为仿佛它们在最小化变分自由能(VFE),而主动推理通过将感知、学习、规划和控制在单一计算目标内统一起来,而非分离的工程子系统,来操作化这一原理。我们表明,变分自由能最小化通过因子图上的反应式消息传递自然实现,其中推理源于局部的、并行的计算。这种实现不仅仅是方便的:它与物理操作的定义性约束非常匹配,包括硬性时间截止、异步数据到达、波动的功率预算以及变化的环境组成。因为反应式消息传递是事件驱动的、可中断的且局部可适应的,所以性能在资源减少时可以优雅降级,而模型结构可以随着相关实体和关系的变化而在线调整。我们进一步表明,在适当的耦合和粗粒度条件下,耦合的主动推理智能体可以被描述为更高层次的主动推理智能体,从而产生一种计算上同质的架构,该架构在各个尺度上使用相同的消息传递原语。我们没有提供与现有方法的基准比较;我们的贡献是使理论和架构上的论据对工程界来说易于理解。
1 引言
RoboCup(机器人世界杯) 是一项国际研究和教育倡议,它利用机器人比赛作为基准问题,以推进人工智能、机器人技术和自主多智能体系统的发展。RoboCup 的最终目标陈述如下: “到21世纪中叶,一支完全自主的人形机器人足球队将在遵守国际足联(FIFA)官方规则的情况下,赢得一场足球比赛,对手是最近一届世界杯的冠军。” 2025年10月,“人形机器人踢足球”类别的 RoboCup 2025 决赛上演了一场使用 Booster T1 机器人的两支队伍之间的比赛。那场比赛的概况可以在 YouTube 上观看。
首先,让我们赞扬并致以应有的敬意,给今天机器人足球系统背后的人类工程团队的技能、独创性和持续努力。他们的成就是实质性的且来之不易。同时,我们需要保持理智的诚实(intellectual honesty)。一支由人类幼儿组成的足球队可能会击败当前世界冠军级别的人形机器人队。当代基于大型语言模型(LLM)的 AI 系统(在文档处理和代码开发等任务中媲美或超越人类专家表现)与物理 AI 系统(如自主足球机器人)之间的能力差距是惊人的。
让我们考虑一下当代机器人足球队背后的技术。它们的开发借鉴了控制理论、信号处理、机器人技术、机器学习和通信等学科的最先进方法,代表了数十年的理论进步和大规模工程努力。
现在,将这些机器人系统的足球技能水平与精英人类足球运动员(如基利安·姆巴佩 Kylian Mbappé) 进行对比。姆巴佩并没有明确运用任何控制理论或强化学习的知识。相反,他的大脑和身体在物理定律下运作,通过与环境的长期互动,产生了远远超过当前人形机器人的足球技能。
事实上,这种性能差距的幅度如此之大,以至于引发了一个问题:继续开发控制和学习算法,是否是通往能够在2050年击败人类世界冠军的人形机器人团队的最有希望的路径?相反,研究生物大脑中的物理过程如何产生信息处理机制(通过环境互动产生卓越的感觉运动技能)可能会更有成效。
我们使用机器人足球的例子仅仅是为了说明人类技能水平与必须在现实世界具身(embodiment)约束下运行的当前物理 AI 智能体之间的巨大性能差距。在本文中,我们更广泛的兴趣是介绍一种开发物理的、具有代理能力(agentic)的 AI 系统的替代方法,其性能可与人类相媲美。
大约二十年前,一个被称为自由能原理(Free Energy Principle, FEP)的统一框架被引入,用于将大脑中的信息处理描述为一个物理过程 [Friston, 2005, 2009]。自其引入以来,FEP 已被进一步发展为一种通用的最小作用量原理(least-action principle),用于描述维持其结构和功能完整性的自然系统的自组织动力学 [Friston et al., 2023a]。关于该理论现状的全面概述见 [Friston, 2019, Friston et al., 2023b]。
FEP 的一个定义性特征是将大脑解释为感官观察的概率生成模型,其中所有信息处理都被视为变分自由能(Variational Free Energy, VFE)的最小化。在这个框架内,认知过程如感知、控制、规划、学习、决策、注意力、习惯形成、探索和想象不再被视为独立的认知能力,而是作为单一推理原则的结果而产生。从工程角度来看,这种统一在概念上是强大的,并且可能非常具有吸引力,因为这些功能通常通过控制、信号处理、机器学习和人工智能中根本不同的方法论来解决。
为了将实际的物理过程与总体的理论框架区分开来,大脑中的 VFE 最小化过程通常被称为主动推理(Active Inference, AIF),尽管这个术语将在论文后面被细化。从工程角度来看,AIF 作为开发能够通过与其环境互动自主获取技能的合成物理 AI 系统的潜在基础特别令人感兴趣。
尽管其概念上的吸引力,关于 FEP 和 AIF 的文献对工程师来说仍然难以深入理解。因此,本文的目的是从工程角度展示 AIF,并阐明为什么它构成了机器人和其他具身 AI 系统领域研究人员的有前途的范式。
论文沿着以下链条(图 2)展开其论点,其中每一步都建立在前一步之上: 7
- 概率论(Probability Theory, PT)。我们采用概率的贝叶斯解释作为信念程度,并回顾求和法则与乘积法则的公理推导 [Cox, 1946, Jaynes, 2003]。
- 贝叶斯机器学习(Bayesian Machine Learning, BML)。完全致力于 PT 以从数据中学习。贝叶斯规则是基本的学习机制;模型性能通过贝叶斯模型证据进行评分。BML 是基于原理的但通常在计算上难以处理。
- 变分推断(Variational Inference, VI)。VFE 最小化作为精确贝叶斯推断的计算上可行的替代方案,在统计物理学中有深厚的根源 [Feynman, 1955, Lanczos, 1986],并在最大熵原理中有公理基础。
- 主动推理(Active Inference, AIF)。完全致力于 VFE 最小化,作为通过动作和感觉与环境互动的物理智能体中唯一的持续过程。
- 因子图和反应式消息传递(Factor Graphs and Reactive Message Passing, RMP)。VFE 最小化实现为因子图上的分布式、事件驱动的消息传递,自然具备在波动的数据、时间和电源资源下运行的能力。
简而言之,本文旨在提供一条清晰的路径,以理解和欣赏主动推理作为一种用于开发物理的、智能体化(agentic)AI 系统的工程技术。我们希望从这一角度展示主动推理将鼓励工程界更大的兴趣和采用。关于 PT、BML 和 VI 的早期部分故意放慢节奏,以便广大读者能够理解。已经熟悉 VI 的读者可以跳到第 5 节,那里开始了主动推理的发展。
2 概率论
我们首先回顾概率论(PT),以建立符号并强调本文其余部分所依赖的特定解释——贝叶斯概率。由于篇幅限制,我们侧重于概念理解,而非形式上的完整性。
引入概率的一个经典方法是让教室里的学生猜测黑板背面的数字 x x,假设 x x 是 1 到 100 之间的整数。不同的学生可能会给出不同的答案,因为他们关于 x x 的知识状态的不确定性可以表示为
Cox 推导出,如果 1–3 成立,那么更新概率的唯一正确方法必须通过求和法则与乘积法则进行:
重要的结论是,任何尝试使用与 (3) 不一致的演算体系(calculus)来操纵信念程度的做法,都有违反 Cox 三个公理中至少一个的风险。换句话说,如果我们接受 Cox 的公理应该成立,那么我们必须使用 (3) 中的求和法则与乘积法则来处理新信息。因此,所有理性的信息处理计算都可以简化为仅对这两条法则的连续应用。在接下来的章节中,我们将展示贝叶斯规则、机器学习、变分推断,以及最终的主动推理,都源自这两条法则。
例 1 提供了一个富有启发性的例子,既突出了概率论(PT)的力量,也指出了依赖直觉而非求和与乘积法则的陷阱。
3 贝叶斯机器学习
贝叶斯机器学习(Bayesian Machine Learning, BML)代表了对概率论(PT)在模型学习(从数据中)和应用上的完全致力于。原则上,BML 是一个可靠的理念,因为任何替代方案都意味着一种违反考克斯(Cox)公理的机器学习学科。
一旦模型 (6) 被指定,并且新的数据集 D D 可用,所有后续处理都通过概率论(PT)进行。实际的学习任务涉及评估
在实际应用中,从业者通常通过利用 (7a) 评估模型证据来迭代候选模型提案,直到获得满意的模型。一旦选择了可接受的模型,通过 (7b) 计算模型参数的后验分布。然后可以应用结果模型,例如如 (9) 中所述。BML 应用于预测硬币投掷的完整示例见示例 2。
4 变分推断
如前所述,当计算资源有限时,评估贝叶斯证据和随之产生的后验分布可能是难以处理的(intractable)。Shore 和 Johnson [1980] 开发了一个约束下推断的公理框架,后来在 [Skilling, 1989, Caticha, 2021] 中得到完善,其精神与 Cox 对 PT(概率论)的公理推导非常相似。
直观上,这些公理要求后验仅由施加的约束决定,而不引入任何无根据的信息。例如,S4 要求校准机器人的相机不得改变对其麦克风参数的信念,因为校准数据不携带关于麦克风的信息。如果满足这些公理,Shore 和 Johnson [1980] 表明相对熵泛函是满足此要求的唯一排序标准。具体地,对于给定的观察集 D D,首选后验被唯一确定为在满足施加约束的同时最大化相对熵的分布。
这种推断方法被称为最大熵原理(Maximum Entropy Principle, MEP)。虽然相对熵是信息论中的一个核心概念,但其负对应物在统计物理学中被称为变分自由能(Variational Free Energy, VFE):
这个过程产生了一个近似的,但在计算上可行的贝叶斯解。
我们得到了一个显著的结果。通过 (7) 进行的精确贝叶斯更新在符合 Cox 公理的意义上是最优的,但由于 (7a) 中需要对 θ θ 进行边缘化,它通常在计算上是难以处理的。变分推断通过将贝叶斯学习重新构建为 (15) 中的优化问题来规避这种边缘化,这在计算上通常容易处理得多。
此外,如果人们用超出数据约束的约束来增强推断问题,那么 Shore 和 Johnson [1980],Skilling [1989],Caticha [2021] 为将约束下的 VFE 最小化视为一种有原则的推断方法提供了强大的公理动机。因此,VFE 最小化不仅仅是一种方便的近似技术,而是一个有原则的(并且在实践中不可避免的)框架,用于在物理 AI 系统面临的实时条件下进行不确定性下的一致推理。这导致了一个关键的概念洞察:在这种约束推断的观点中,贝叶斯规则表现为 VI 的一个特例,其中唯一的约束编码了观察到的数据,并且对允许的后验族没有施加限制。 因此 VI 比贝叶斯规则更通用,因为它适应了现实世界智能体不可避免地面临的额外约束(计算、结构或分布)。
为了强调这一点,(12b) 中的惊讶度-界分解可以解释为问题表示成本和解决方案成本的分解。具体而言,惊讶度量化了模型表示环境的程度,而在解决方案中对模型的任何实际使用必然会产生推断成本。一个重要的结果是,具有相对较差的问题表示(高惊讶度)但与高效推断过程(低解决方案成本)配对的模型,可能比具有高贝叶斯证据但推断过程昂贵或不准确的模型实现更低的 VFE。这意味着具有最高贝叶斯证据的模型不一定在实践中最有用,因为贝叶斯证据仅评估问题表示的质量而忽略了推断的计算成本。因此,将 VFE 仅仅解释为惊讶度的上界是不完整的。相反,VFE 提供了一个更有原则的性能标准,因为它联合评估了模型保真度和推断过程的计算成本,这是在实时和资源约束下运行的物理 AI 系统的基本考虑因素。
这种更广泛的解释得到了 (12d) 中能量-熵分解的加强,该分解将 VFE 与统计物理学的自由能泛函联系起来。更一般地,变分自由能原理与 Jaynes 的最大熵原理密切相关,并通过统计力学与热力学第二定律密切相关。因此,变分推断不应仅仅被视为对精确贝叶斯推断的近似,而应被视为信息处理的基本原理。
贝叶斯逻辑回归的这种 VI 工作流的一个示例见示例 3。
5 自由能原理与主动推理
我们现在转向物理 AI 智能体,即,在现实世界中具身化(embodied)并通过物理身体行动的系统。一个物理 AI 智能体,
- 从其环境接收感官输入,
- 基于这些观察执行推断和决策,并且
- 通过其执行器(actuators)生成影响环境的物理动作。
物理 AI 智能体的一个定义性属性是存在一个封闭的感知-动作循环,其中动作改变环境,随后环境产生新的感官输入。这个循环可以抽象为
图 3 说明了这种状态划分以及由此产生的感知-动作循环。感知和动作之间的这种循环耦合将物理 AI 智能体与在没有与其环境进行具身交互的情况下运行的“离线” AI 系统区分开来。
在本节中,我们简要总结自由能原理(FEP)。关于其推导的核心参考文献包括 [Friston, 2019, Friston et al., 2023a]。第 5.1 节的陈述遵循基于物理的路径,从非平衡稳态动力学开始。从工程角度来看,FEP(及其相关过程,主动推理)可以被理解为完全致力于 VFE 最小化,作为与其环境交互的物理 AI 智能体的统一计算原理。倾向于将 FEP 视为给定条件的读者可以直接跳到第 5.2 节,那里恢复了工程开发。
5.1 自由能原理:维持其同一性(Identity)的系统的动力学
FEP 的出发点是观察到许多自然系统消耗能量进行自组织,从而随时间维持其结构和功能的完整性 [Friston, 2013]。生物体是此类自组织系统的典型例子。FEP 通过以下假设将这种直觉形式化 [Friston, 2013, Friston et al., 2021, 2023a,b]:
这表明 AIF 过程可以被解释为一个动力系统,其自主状态的演化是为了最小化惊讶度(surprisal)。每当系统漂向稳态概率较低的区域时,动力学方程 (25) 倾向于将其推回概率较高的区域,从而维持智能体的可识别形态。
方程 (25) 中的动力学构成了在假设 F1–F3 下 FEP 的核心数学结果。在额外的变分解释下,这些动力学可被视为主动推理(AIF)过程,其中内部状态编码关于外部状态的信念,而控制状态采取行动以使感觉与预测相匹配。我们首先展示 (25a) 如何对应于内部状态 s s 的 VFE 最小化,然后将这一视角扩展到控制过程。
5.2 内部状态估计作为 VFE 最小化
5.3 规划与控制作为 VFE 最小化
。假设智能体对未来持有一些额外的先验信念。首先,我们假设偏好先验(preference priors)编码了期望的未来状态。其次,我们假设认知(“寻求信息”)先验信念(epistemic ("information-seeking") priors beliefs)
5.4 嵌套主动推理智能体
第 5.1 节确立了满足假设 F1–F3 的系统在上述变分解释下允许主动推理的解释。一个自然的后续问题是,AIF 智能体的内部状态 s s 本身是否可以由更低级别的 AIF 智能体组成,如果是,在什么条件下。这个问题在实践中很重要:如果答案是肯定的,那么人们可以通过组合更简单的 AIF 智能体来构建大规模智能系统,而无需离开 VFE 最小化框架。这将提供显著的工程优势,因为工程工作随后可以完全专注于高效的 VFE 最小化,这可以以一种非常适合处理典型物理 AI 约束的方式实现(将在第 6 节讨论)。答案在 Friston [2019],Friston et al. [2021],Hipólito et al. [2021],Fagerholm et al. [2021] 中有所发展,即在合适的结构和粗粒化(coarse-graining)条件下,一组耦合的 AIF 智能体本身可以被描述为更高级别的 AIF 智能体。
当多个智能体相互作用时,并非所有碳状态在集体尺度上扮演相同的角色。因此,我们区分 面向外部的毯状态 (outward-facing blanket states),它们与集合外部的环境交互,以及 面向内部的毯状态 (inward-facing blanket states),它们调节集合内智能体之间的耦合。具体地,我们写
E2 时间尺度分离。每个智能体内部的局部推理动力学在比智能体间耦合更快的时间尺度上运行。因此,快速的智能体内波动可以通过准稳态平均来近似,从而产生以慢速集体模式表示的简化描述。这种粗粒化允许集合动力学用集体变量来表达,变分自由能的解释随后可以应用于这些变量(如果条件 E1 和 E3 也成立)[Friston et al., 2021, Friston, 2019]。
5.5 探索性行为涌现于嵌套 AIF 智能体
通过连续的粗粒化,从随机微观动力学到近乎确定性的宏观行为的转变,在理论物理学中有一个众所周知的类比,即对微观量子涨落进行平均会产生受变分(最小作用量)原理支配的宏观动力学 [Feynman, 1965]。弗里斯顿(Friston)在这种从量子到经典的转变与嵌套 AIF 智能体的粗粒化之间,明确地建立了一个类比 [Friston 等人,2023b, a]。
6 实现:因子图与反应式消息传递
6.1 Forney 风格因子图
Forney 风格因子图(FFG)是联合概率分布因式分解的图形表示 [Kschischang 等人,2001,Loeliger,2004,Loeliger 等人,2007]。在 FFG 中,方形节点表示因子(局部函数),边表示变量,并且该图将联合分布的因式分解编码为这些因子的乘积。每个因子节点仅连接到与其参数相对应的边,从而使模型的条件独立结构变得明确。
就我们的目的而言,FFG 的重要性在于它们将推理展现为严格局部计算的集合,这使它们成为物理 AIF 智能体中分布式 VFE 最小化的自然计算基质。
这仅需执行几百次局部运算。显然,利用这种分配结构所获得的计算收益是巨大的。
总结而言,稀疏连接模型(即每个因子仅依赖于相对较小变量子集的因式化模型)中的贝叶斯推理,可以通过在 FFG 上进行消息传递来高效实现。由此产生的消息传递过程只需要在节点处进行局部计算。
6.2 因子图上的约束变分推理
本节的目标是表明,在 6.1 节中直观推导出的消息传递算法,可以作为因子图上约束 VFE 最小化的平稳解被恢复(recovered)。这一结果确立了消息传递不仅仅是一种计算启发式方法,而是原则性的变分推理。
Bethe 约束使得在具有因式分解结构(42)的模型中进行基于局部消息传递的变分推理成为可能。额外的约束(46)强制相邻因子信念与变量信念之间的一致性。
为每个一致性约束引入拉格朗日乘子并对 CBFE 求泛函导数,可得到形式如下的局部平稳解 [Senoz et al., 2021, Theorem 1]
公式 (47) 和 (48) 重现了我们在 6.1 节中阐述的和积算法。在这个意义上,消息传递可以被理解为源于约束变分推理,而非源于分配律的代数变换。CBFE 视角更为通用,因为它能自然地容纳推理任务上的额外约束。
6.3 反应式消息传递与 RxInfer
Bagaev [2023] 将反应式编程(reactive programming)的概念引入了基于 CBFE 的消息传递中。在反应式消息传递(RMP)框架中,因子图中的每个节点都作为一个自主的计算单元,其更新会根据传入的变化在局部进行调度。只有当传入消息发生变化时,才会处理消息更新,这使得推理能够通过局部事件驱动的更新来进行。例如,当一个新的传感器数值仅改变了一个局部似然因子时,只有图的相邻部分需要立即更新,而不是整个模型。通过这种方式,CBFE 的降低是通过分布式局部计算来实现的,尽管实际行为仍然取决于图结构、更新调度以及近似选择。此外,每个节点还可以动态地(on-the-fly)抑制无信息量的消息(例如那些接近均匀分布的消息),从而减少计算负载。
这种最小化 CBFE 的反应式消息传递框架已在开源 Julia 工具箱 RxInfer$^{15}$ [Bagaev 等人,2023] 中实现。在 RxInfer 中,使用者指定一个生成模型以及一组变分约束,从而定义一个 CBFE 泛函。当满足前面几节讨论的条件时,该泛函对应于 AIF 智能体的 VFE 目标。然后,RxInfer 可以通过持续的反应式消息传递协议自动最小化由此产生的自由能。为了具体展示其工作流程,下面的伪代码概述了如何在 RxInfer 中指定和推断一个简单的状态空间模型:
总之,因子图为最小化变分自由能提供了一种并行、分布式的架构。每个节点仅执行局部计算,而跨图的集体消息传递解决了全局推理问题。CBFE 公式使该框架具有灵活性,因为可以在单个节点和边上局部指定变分族的约束,从而在推理精度和计算成本之间实现原则性的权衡。反应性(Reactivity)增加了鲁棒性和自主性:由于每个节点独立响应传入消息,即使数据异步到达、传感器故障或计算资源波动,推理也可以不间断地进行。下一节解释了为什么这种推理范式特别适合物理智能体所面临的资源约束。
7 作为主动推断智能体的物理 AI 智能体
前几节提出了两个互补的论点。第 5 节表明,FEP 为具身智能体提供了一个规范性的、基于第一性原理的设计框架:在 FEP 的假设下,随时间保持其结构和功能完整性的系统可以被描述为仿佛在最小化变分自由能。AIF 通过将感知、学习、规划和控制统一在一个单一的计算目标——VFE 最小化——中,使这一原则具体化,而不需要为每个功能设置单独的机制。第 6 节表明,VFE 最小化可以通过因子图上的反应式消息传递高效且分布式地实现,其中每个节点自主地仅执行局部计算,而网络集体解决全局推理问题。综上所述,这些结果表明,由因子图上的反应式消息传递实现的 AIF 框架,为物理 AI 智能体设计提供了原则性的基础。
7.1 用于鲁棒性的持续反应式消息传递
为了理解这对物理 AI 为何重要,请考虑现实世界物理 AI 设备所面临的波动操作条件,这是常态,而非罕见的极端情况:
这些不是偶然的工程困难;它们是具身、实时操作的定义特征。一个原则性的鲁棒架构必须同时处理所有这四个问题,而不需要设计者预先预测每种条件组合。
因子图上的持续反应式消息传递非常适合这一挑战。因为每个节点响应到达的消息而不需要全局调度,推理是事件驱动的:一旦新数据到达更新就进行,当没有新信息可用时暂停。硬时间截止日期可以通过在所需时刻提交当前信念来处理,无论消息传递是否已收敛。异步或缺失的观测值在局部被吸收而不影响图的其余部分。计算资源的减少仅仅意味着单位时间内交换的消息更少,并且由于每个完成的局部更新都被设计为降低 CBFE,系统以原则性的方式用精度换取速度。
CBFE 框架进一步允许通过选择适当的变分约束(第 6.2 节)在每个节点局部调整推理的复杂度。在紧张资源预算下运行的节点可以采用更廉价的平均场近似,而资源充足的节点可以使用更具表现力的结构化 VMP 或期望传播更新。这种局部适应性不需要对推理算法进行全局重新设计。
关键在于,所需的计算资源无法预先调度:当环境偏离预期时,计划必须不断更新,而这种偏离按定义是未预料到的。
以这种方式实现的 AIF 智能体因此继承了与物理部署直接相关的属性:
- 统一设计: 感知、学习、规划和动作选择都归结为单一生成模型中的 VFE 最小化,消除了集成单独工程子系统的需要。
- 随时推理(Anytime inference): 反应式消息传递可以在任何时刻被中断并返回当前最佳可用信念,使得硬实时截止日期变得可处理,而无需专用调度。
- 容错性: 局部自主性允许节点故障或传感器缺失保持在局部,因此性能降级比紧密集中的架构更为平稳。
- 资源适应性: 精度-成本权衡通过变分约束在局部控制,允许智能体在广泛的计算预算范围内运行而无需架构更改。
7.2 计算同质性
另一个架构上的推论值得强调。本文所发展的框架允许 AIF 智能体的嵌套实现,而无需在更高的组织层次上引入新的计算原语。层级中的任何层次都不引入不同的计算机制:在每个尺度上出现的唯一操作,都是 (48) 的消息计算。
这种计算同质性对硬件设计具有启发性的意义。一个实现 (48) 的处理单元可以作为广泛 AIF 实现的可复用构建块。平铺此类单元并根据因子图拓扑连接它们,可能就足以实现任意复杂度的 AIF 智能体。除了消息传递基底之外,不需要单独的控制逻辑、调度器或全局推理引擎。无论智能体是单个传感器节点还是大型多模态机器人系统,所需的硅操作都是相同的。为了说明这一点,一个传统的基于 RL 的机器人通常结合了卷积感知模块、树搜索或模型预测规划器、PID 控制器以及策略梯度学习算法,每一个都需要不同的计算原语、软件栈和集成接口。在 AIF 框架中,所有这些功能都归结为同一形式 (48) 的消息计算。
因此,因子图上的反应式消息传递不仅仅是一种便利的实现策略。它是将 VFE 最小化的结构与现实世界约束的结构相匹配的计算架构,并且它提供了一种同质的基底,可以从单个处理单元扩展到完整的智能体层级,而无需改变底层的计算原语。
7.3 示例:一个主动推理机器人足球队
我们现在勾勒本文所发展的框架如何应用于一支机器人足球运动员队伍。目标不是一份工程规范,而是一个具体的演示,表明 VFE 最小化、基于 EFE 的规划、反应式消息传递和嵌套 AIF 智能体如何自然地组合成一个连贯的物理 AI 架构。
7.3.1 作为 AIF 智能体的单个球员
每个球员在由共享智能体间空间引起的耦合下最小化自己的 VFE。协调行为(间距、传球序列、角色分化)在没有中央控制器的情况下涌现。每个球员基于 EFE 的策略选择自动考虑了队友的预期行为,因为共享的智能体间状态在链上传播信念更新。
7.3.3 波动资源下的反应式消息传递
足球使第 7 节的资源约束变得具体。球员必须在数百毫秒内决定传球还是射门(时间约束);队友之间的观察是部分且异步的(数据约束);计算和运动预算随电池状态和对手数量而波动(功率约束)。持续的反应式消息传递同时处理所有这三个问题:推理是事件驱动的,可以在任何截止时间前提交;缺失的观察仅影响局部图区域,并导致信念向先验衰减;资源减少意味着每秒更少的消息迭代,对应于更粗略的变分近似,因此性能平滑下降而不是崩溃。相同的机制扩展到团队级别,而没有引入任何新的计算原语,这正是本文通篇所主张的架构同质性。
8 讨论
8.1 背景
本文旨在作为 Friston 等人 [2022] 愿景论文的补充,该论文认为主动推理为设计自然和人工智能生态系统提供了一阶原理基础。那篇论文描绘了一条日益复杂的路线图,从当前的功能近似 AI(阶段 S0)到感知(S1)、复杂(S2)、共情(S3)和共享(S4)智能,并确定因子图消息传递作为使智能体能够共享生成模型并通过交换充分统计量进行协调的计算架构。
本文解决了 Friston 等人 [2022] 有意留待解决的问题:工程师究竟应该如何构建填充这样一个生态系统的个体智能体?
本文的几个具体贡献填补了 Friston 等人 [2022] 中识别出的空白。首先,我们表明,在 Forney 式因子图上的反应式消息传递直接解决了任何物理智能体所面临的实时、数据和功率约束(第 7 节),这些约束被 Friston 等人 [2022] 承认为基础性的,但未在工程细节上加以处理。其次,第 7 节的计算同质性结果,即因子图中的每个节点执行相同的 VFE 最小化消息计算,提供了架构原语,Friston 等人的多智能体生态系统可以从中组装,而无需在每个尺度上引入新机制。第三,第 6.2 节的约束贝特自由能框架为工程师提供了一个具体的旋钮,即局部变分约束的选择,用于在每个节点上权衡准确性与计算成本,这是边缘设备在 Friston 等人 [2022] 通过兰道尔原理强调的能量预算下运行的一项基本能力。
Dupoux 等人 [2026] 提供了一个补充视角,他们确定自主学习是物理 AI 的核心未解决问题,并提出了一个三组件架构:基于观察的学习(系统 A)、基于行动的学习(系统 B)和一个元控制器(系统 M),该系统根据内部生成的信号(如预测误差、新颖性和不确定性)路由数据并切换学习模式。我们赞同他们的诊断:当前 AI 系统无法像生物有机体那样自主地学习,弥合这一差距需要紧密耦合感知、行动和探索的内在驱动力。
然而,这些架构在基础承诺上有所不同。Dupoux 等人 [2026] 的框架有意对数学基底持不可知论态度:学习目标是通用的损失函数和期望回报最大化器,而不确定性仅作为标量元信号(预测误差、集成方差)进入,这些信号启发式地调节数据路由和探索。概率论没有明确的作用。
8.2 通往主动推理的两条路径
主动推理和自由能原理可以通过两条互补的路径来接近,这与 Parr 等人 [2022] 描述的大路和小路密切相关。
大路。大路是与 Friston 对 FEP 的原始推导相关的物理学和神经科学路径 [Friston et al., 2023a,b]。在这条路径中,核心结果——自主状态动力学可以表达为变分自由能最小化——是从关于自组织系统物理动力学的假设中推导出来的。在本文中,这条路径在第 5.1 节中进行了回顾,最终导致 (25) 的自主状态动力学及其在 (28) 中的变分重新解释。
小路。小路从概率和推理原理出发,而不是从物理学出发。最近的一个重要贡献是 Beck 和 Ramstead [2025] 的工作,他们从杰恩斯的最大校准原理以及马尔可夫毯假设推导出核心 FEP 结果。在他们的表述中,人们再次得出这样的结论:自主状态的更新可以表达为变分自由能最小化,但无需假设 Friston 推导中使用的物理假设。在这个意义上,Beck 和 Ramstead 从信息论的角度阐明了 FEP 是什么:一个针对具有马尔可夫毯动力学的系统的有原则的推理定律,而不是某个特定物理起点的必然结果。
本文也属于这条小路,但侧重点不同。虽然 Beck 和 Ramstead [2025] 提供了 FEP 的另一种推导,但我们的重点在于为什么从事物理 AI 的工程师应该关注 FEP/AIF 框架,以及合成 AIF 智能体如何在实践中实现。我们的发展遵循以下路径
从关于不确定性下理性推理的基本假设,逐步推进到现实世界操作条件下物理 AI 智能体的实现。
这两条路径是互补的,而不是相互竞争的。大路为为什么自组织系统应该被期望最小化自由能提供了基于物理学的理由。小路表明,同样的原理可以从概率论和推理中理解,并且它为关心构建合成智能体的工程师提供了更直接的切入点。
8.3 主动推理与强化学习
表 1 总结了经典模块化 AI 系统与通过反应式消息传递实现的 AIF 之间的关键架构差异。强化学习(RL)和主动推理都提供了设计与环境交互以实现目标的智能体的框架。然而,它们的差异超越了表面的区别。我们强调两个关键问题:奖励函数问题和计算同质性。
这引入了两个相关的困难。首先,不确定性和探索的处理通常是通过额外的建模选择引入的,而不是内置于核心目标中。这并不意味着 RL 无法表示不确定性或支持探索:贝叶斯 RL、POMDP 控制以及内在动机方法都能做到。对比在于,这些要素通常作为额外组件或辅助目标引入,而在主动推理中,认知项和目标导向项被组合在一个单一的变分目标内。其次,奖励函数仍然必须由人类实践者设计。指定一个能在物理部署中遇到的各种操作条件下产生期望行为的奖励函数是出了名的困难,并且仍然是一个未解决的问题。此外,在标准 RL 中,智能体没有原则性的机制来解决其关于 R 是否正确的自身不确定性,因为 R 对于推理过程来说是外部的。
计算同质性。 第二个架构差异涉及智能体必须执行的计算的均匀性。典型的 RL 系统由异构模块组成(感知模块、世界模型、策略网络、价值估计器和探索启发式),每个模块都用不同的目标训练,并用不同的计算机制实现。这些模块的集成是一项重大的工程挑战,并且它们之间的接口往往是物理部署中脆弱性的来源。相比之下,主动推理强制承诺将 VFE 最小化作为智能体层级每个层次上唯一的计算引擎,其工程后果在第 7.2 节中讨论。这种均匀性还带来了实际优势。物理智能体必须应对时间截止、异步数据到达、变化的功率预算和变化的环境组成(第 7.1 节),而在模块化 RL 系统中,每个组件都必须单独针对这些波动进行加固。当计算引擎固定为连续的反应式消息传递时,许多智能体功能可以在相同的推理架构内处理,从而减少了应对这些波动所需的单独工程量。
8.4 主动推理、主动学习与主动选择
到目前为止,我们对合成 AIF 智能体设计的讨论一直假设实践者指定了生成模型,该模型由预测模型和偏好模型组成(见 (30),其中认知先验由 (29) 给出)。
有两点值得强调。首先,主动学习不需要对 FEP 框架进行临时添加;它从与感知和控制相同的变分机制中涌现出来。其次,这种学习是真正主动的:不确定性的减少与 EFE 的其他组成部分(特别是风险和模糊性)进行平衡。因为风险捕捉了行为的目标导向方面,所以由此产生的学习压力不是抽象的一般好奇心,而是由智能体的偏好结果塑造的。在这个意义上,主动推理并不单纯偏好学习本身;它偏好对自适应、目标导向行为有用的学习,因此可能支持比无定向探索更简约的模型。
在生物系统中,人们可以将这一想法更进一步,并询问生成模型本身的结构是如何获得的。在进化时间尺度上,人们可以将其视为 FEP 下的一种结构学习形式,自然选择塑造了有机体可用的模型类别。在工程背景下,相应的理想情况是,只需要在偏好模型中指定高层设计约束,例如与清洁机器人任务相关的期望未来状态,而较低层次的模型结构则是自主学习的。
这推动了当前关于生成模型结构的主动选择的工作 [Friston et al., 2024, 2025]。在这里,目标同样是保持在相同的 VFE 最小化框架内,但现在使用 EFE 来指导模型选择和结构学习。具体来说,这意味着在候选模型结构中进行选择,例如决定飞行中球的动力学是更好地用线性还是非线性状态空间模型来捕捉,或者是否应该包含一个表示风的潜在变量,并有选择地获取最有助于区分这些候选模型的数据。在这种设置下,主动选择不仅仅是一般意义上的主动数据收集,而是为了解决关于模型结构的不确定性而进行的数据收集,同时保持对 EFE 中智能体其他目标(包括风险、模糊性和新颖性)的敏感。据我们所知,如何将此类主动选择策略集成到因子图消息传递框架中,仍然是一个未解决的问题。
8.5 局限性
我们相信,主动推理作为物理 AI 基础的理论依据是坚实的。本文提出的论点建立在概率论、变分推理和因子图消息传递之上,其中每一项都是一门成熟且被充分理解的学科。在这方面,AIF 的基础并不比强化学习或最优控制的基础逊色。
然而,工程方面的依据在很大程度上仍未得到验证。本文声称的大多数优势,包括随时推理、有原则的探索以及在资源约束下的优雅降级,已在中小规模实验中得到了证明,但尚未在那些这些特性最为重要的大规模、实时物理部署中进行压力测试。弥合理论前景与工程实践之间的差距是 AIF 社区面临的核心挑战。
这一差距的一个具体症状是工具的现状。在实践中实现 AIF 智能体需要软件基础设施来指定生成模型、执行反应式消息传递以及在运行时管理计算图。RxInfer(第 6.3 节)[Bagaev et al., 2023] 是为此目的最成熟的开源平台,代表了一个重大进步,但它尚未达到工程师期望从生产级工具中获得的稳健性、文档和社区支持水平。缺乏维护良好、专业支持的工具箱是该领域尚未克服的实际采用障碍。
一个相关的局限性是缺乏具备概率推理、因子图和实时嵌入式系统综合背景的工程人才,而这正是 AIF 智能体开发所需要的。该领域目前主要吸引来自理论神经科学、哲学和数学物理界的人士,这些社区的研究重点和工程规范与机器人学、信号处理和控制领域存在显著差异。
9 结论
本文论证了主动推理为物理 AI 智能体提供了一个有原则的架构框架。从概率论、贝叶斯机器学习和变分推理出发,我们展示了主动推理如何将这些思想扩展到必须在不确定性下实时感知、学习、规划和行动的具身智能体。从这个角度来看,变分自由能提供了一个统一的计算目标,取代了表征许多当代物理 AI 系统的由单独工程化目标组成的碎片化集合。
论证的第二部分涉及实现。我们认为,因子图上的反应式消息传递提供了一种分布式计算架构,它与物理部署的约束非常匹配。由于计算是局部的、事件驱动的且可中断的,这种架构天然适用于硬性时间截止、异步数据到达、波动的功率预算以及变化的环境组成。相同的消息传递原语还可以在嵌套的组织层次中重复使用,从而产生从内部组件到多智能体系统的计算同质架构。
因此,本文的贡献不是一项基准研究,也不是声称已经实现了大规模工程验证。相反,它是为了使主动推理的理论和架构论据对工程受众来说易于理解,并论证该框架值得作为物理 AI 的基础被认真考虑。如果要缩小当前具身 AI 系统与生物智能体之间持续存在的差距,我们认为,进步不仅需要更好的实现,还需要更好的架构原则。我们已经论证,主动推理是这样一个原则的有力候选者。
原文链接:https://arxiv.org/pdf/2603.20927
热门跟贴