通用先验:通过贝叶斯推断与预训练求解经验贝叶斯

Universal priors: solving empirical Bayes via Bayesian inference and pretraining

https://arxiv.org/pdf/2602.15136v2

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

摘要

我们为 [TJP25] 近期的一项实证发现提供了理论依据,该发现表明,在合成生成数据上预训练的 Transformer 在经验贝叶斯(EB)问题上表现强劲。我们采用间接途径来处理这一问题:不分析模型架构或训练动态,而是探究为何在预设训练分布下训练的预训练贝叶斯估计器能够适应任意测试分布。聚焦于泊松经验贝叶斯问题,我们识别出通用先验的存在性,使得在这些先验下训练能够对所有测试分布一致地产生接近最优的后悔界 。我们的分析利用了贝叶斯统计学中经典的后验收缩现象,表明预训练贝叶斯估计器正是通过后验收缩来适应未知测试分布的。这一视角还解释了长度泛化现象,即测试序列长度超过训练长度时,模型使用分数阶后验进行贝叶斯推断。

1 引言

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

在本文中,我们研究 [TJP25] 中方法的统计方面。具体而言,我们提出以下问题:

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

1.1 最不利先验之先验与可容许性

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

1.2 通用先验之先验

虽然命题1.1为算法1中的预训练方法提供了理论依据,但仍需要识别出近似最不利的先验之先验。这促使我们定义如下 “厚”先验之先验,它为达到较小最坏情况后悔值提供了充分条件。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

我们的下一个结果表明,厚先验之先验(具有适当的速率函数 E E)是通用的,并建立了在厚先验之先验下分层贝叶斯估计量的后悔界。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

1.3 长度泛化

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

1.4 相关工作

打开网易新闻 查看精彩图片

元学习。我们使用预训练Transformer的方法——在先验分布上训练,并在测试时无需针对每个实例进行优化——属于元学习框架 [HAMS21]。近期大量工作研究了Transformer的上下文学习,这是一种通常通过自回归下一词元预测实现的元学习形式 [GTLV22, BCW+23, ASA+23, VONR+23]。特别地,上下文学习与贝叶斯推断之间的联系已在实证 [MHA+22, PAG24, ADM25] 和理论 [XRLM22, WS25, MWS25] 两方面被观察到。这一联系启发了开创性的TabPFN框架 [HMEH23, HMP+25] 以及若干关于表格数据摊销推断的后续工作 [MTH+25, RRFHR25, MBML25, MBL+25]。类似的后验收缩思想已出现在自回归 [XRLM22, MWS25] 和扩散设置 [JYL+26] 中;相比之下,我们的经验贝叶斯应用将Transformer视为序列到序列映射 [TJP25]。这种对序列到序列映射的贝叶斯视角也通过分数阶后验为长度泛化 [AWA+22, PQFS24, ZBL+24, ZAC+24] 提供了统计解释,而非依赖于Transformer特定的架构或算法机制 [AM24, INL26, HYB+25]。

“贝叶斯”经验贝叶斯。使用分层/非参数贝叶斯模型 (3) 来解决经验贝叶斯问题属于 [DL81] 的“贝叶斯经验贝叶斯”框架,其中一系列工作 [Ant74, GK17] 选择狄利克雷过程(DP)[Fer73] 作为先验。经验贝叶斯中分层贝叶斯估计量的统计保证可追溯到 [Dat91] 的渐近最优性结果,相关发展见 [PRS14, RRP24];非渐近保证仅在我们的工作和独立同期工作 [IK26] 中建立。两项工作都通过后验收缩建立了后悔保证,分别聚焦于泊松和高斯经验贝叶斯问题。两篇论文在动机上存在概念差异。[IK26] 研究狄利克雷过程先验下非参数贝叶斯估计量的最优性,计算通过Gibbs采样器 [Nea00] 完成。相比之下,我们的动机更偏向机器学习:我们聚焦于预训练Transformer,通过预训练摊销计算,并由此建立了长度泛化结果。其他细微差异包括我们在命题1.1中建立了极小极大定理,而他们的工作将后验收缩论证推广到复合决策问题;我们还注意到,命题1.2中关于泊松经验贝叶斯的可容许性结果受其工作启发。

2 通过后验收缩的分析

2.1 预备知识

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

2.2 后验收缩

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

3 讨论

在本节中,我们讨论有限批次数量上的预训练,以及将研究扩展到先验具有有界支撑的泊松经验贝叶斯设定之外的情况。推迟的证明见第C节。

3.1 有限批次数量

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

3.2 关于泊松经验贝叶斯的更多讨论

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

4 数值实验

4.1 后悔表现与长度泛化

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

4.2 贝叶斯推断的证据

我们的第二组实验旨在验证我们主要定理所依据的假设,即(1)预训练Transformer近似实现了训练先验之先验下的贝叶斯估计量,以及(2)对于长度泛化,预训练Transformer确实在 α α-后验下进行贝叶斯推断。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

原文链接:https://arxiv.org/pdf/2602.15136v2