通过贝叶斯非参数方法实现的复合决策与经验贝叶斯

Compound decisions and empirical Bayes via Bayesian nonparametrics

https://arxiv.org/html/2602.20115v1

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

摘要

我们研究高斯序列复合决策问题,并从经验贝叶斯、基于遗憾值的角度分析一种贝叶斯非参数估计量。受经典非参数极大似然估计量(NPMLE)的精确结果的启发,我们探究是否可以使用标准的贝叶斯非参数先验获得类似的保证。我们表明,基于狄利克雷过程的贝叶斯过程能够达到接近最优的遗憾界。我们的主要结果是在复合决策框架下陈述的,其中均值向量被视为固定的,同时我们也在一个层级模型下提供了并行的保证,在该模型中,均值是从一个真实的未知先验分布中抽取的。后验均值贝叶斯法则当然是可以采纳的,而我们表明NPMLE代入法则是不可以采纳的。

1 引言

经验贝叶斯(EB)方法 [Robbins, 1956, Efron, 2019] 为在大量相关估计问题中借用信息强度提供了一个原理性框架。EB文献中最重要的结果之一来自Jiang和Zhang [2009],他们使用Robbins [1950]以及Kiefer和Wolfowitz [1956]的非参数极大似然估计量(NPMLE),在高斯序列模型的去噪问题中建立了精确的风险保证。Jiang和Zhang [2009]的风险界本质上是频率学派的,因此为EB方法提供了频率学派的可信度。很自然地会问,完全贝叶斯方法是否能提供类似的保证。令人惊讶的是,自Datta [1991a]的工作以来,这个问题很少受到关注。

在本文中,我们证明使用基于Ferguson [1973]的狄利克雷过程(DP)先验的标准贝叶斯非参数(BNP)方法,可以获得很强的频率学派风险保证。除了这些风险保证之外,我们还继承了通过用户指定的先验进行完全显式正则化的通常好处(相较于NPMLE的隐式正则化 [Polyanskiy and Wu, 2020])以及贝叶斯不确定性量化。

1.1 统计设定与主要结果预览

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

1.2 本文结构

本文组织如下。第2节讨论相关工作。在第3节中,我们在经验贝叶斯模型下分析BNP估计量,其中(CD)和(B)共同支配数据生成;这作为我们主要结果的铺垫。第4节包含我们的主要理论贡献:在纯频率学派复合决策模型(CD)下BNP估计量的风险界。在这两节中,我们还证明了BNP估计量是可以采纳的,而NPMLE则不是。第5节使用Good [1992]的框架将我们的工作置于贝叶斯和经验贝叶斯方法的更广泛层级中。第6节展示数值结果。证明收集在补充材料中。

2 相关工作

打开网易新闻 查看精彩图片

超越(CD),同时考虑(CD)和(B)将我们引向Deely和Lindley [1981]的“贝叶斯经验贝叶斯”(BEB)格言。使用狄利克雷过程对该格言的经典实现包括Antoniak [1974]以及Berry和Christensen [1979]。该格言最近在几个方向上重新引起了兴趣。一条工作线将EB的应用范围扩展到序列模型之外,特别是高维广义线性模型 [Weinstein et al., 2025] 1 1;以及一般概率对称性 [Wu et al., 2025];我们的结果通过加强序列模型内的理论基础来补充这些工作。

贝叶斯EB视角也有其他近期发展。Cannella等人 [2026] 在平行且独立的工作中,在(CD)和(B)下发展了与我们密切相关的理论;特别是,他们的定理3.3类似于我们的定理3.1,但不涵盖定理1.2的复合设定。他们利用这一点来解释Teh等人 [2025] 的经验观察,即在合成数据上预训练的Transformer在EB问题中实现了低遗憾值。Favaro和Fortini [2025] 使用牛顿算法发展了一种EB的序贯方法,将其解释为贝叶斯预测学习规则 [Fortini and Petrone, 2020]。关于推断,Ghosal [2022] 建议使用BNP为经验贝叶斯估计量(例如后验均值)构建置信区间,作为Ignatiadis和Wager [2022] 置信区间的一种替代方案;Ignatiadis和Ma [2025] 通过BNP将Ignatiadis和Sen [2025] 的经验部分贝叶斯检验方法扩展到先验和似然均未知的情形。Lee和Sui [2025] 考虑了Efron [2016] 的log样条G-建模方法的层级贝叶斯版本。对于二项式EB问题,Gu和Koenker [2017] 比较了NPMLE和BNP方法,发现二者表现相当。

在(CD)和(B)成立的设定中,恢复真实混合测度在非参数贝叶斯文献中得到了一些关注。关于已知误差分布的反卷积中潜在密度的贝叶斯估计,参见Donnet等人 [2018a],Rousseau和Scricciolo [2024]。Kankanala [2025b] 研究了在各种潜变量模型中,通过使用基于矩的拟似然更新先验所获得的拟贝叶斯后验的收缩速率。

3 通过贝叶斯非参数方法实现的经验贝叶斯 3.1 经验贝叶斯遗憾值

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

3.2 贝叶斯性质与可采纳性

打开网易新闻 查看精彩图片

现在我们转向NPMLE和BNP估计量的可采纳性。我们首先在(CD)和(B)下的EB设定中形式化可采纳性;关于经验贝叶斯决策可采纳性的背景,另见Boyer和Gilliland [1980],Balder等人 [1983]。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

3.3 后验收缩与定理3.1的证明

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

以下结果是Ghosal和van der Vaart [2001,定理5.1]的一个小幅加强:除了收缩速率本身之外,它还追踪了相应的高概率事件。

打开网易新闻 查看精彩图片

4 通过贝叶斯非参数方法实现的复合决策 4.1 复合决策遗憾值

打开网易新闻 查看精彩图片

4.2 贝叶斯性质与可采纳性

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

4.3 后验收缩与定理4.1的证明

整体证明策略包含四个主要元素,我们依次概述如下:

  1. 简化到可分决策规则;

  2. 复合决策基本定理;

  3. (CD)下的后验收缩;

  4. 遵循Jiang和Zhang [2009] 对后验均值的控制。

首先,我们定义简单可分决策规则的类别:

打开网易新闻 查看精彩图片

作为预备步骤,我们注意到以下定量界,归功于Greenshtein和Ritov [2009,定理5.1],它改进了Hannan和Robbins [1955] 的早期结果;另见Han等人 [2025,定理4.1] 以及Liang和Han [2025]。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

5 I. J. Good的阶梯
通过(CD)、(B)和(BB)建立的层级结构可以进一步延续,比如说,

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

6 数值结果 6.1 关于实现的说明

在整个过程中,为了计算 μ 的BNP估计量,我们对 ( B B ) 中狄利克雷过程的超参数做如下选择:

打开网易新闻 查看精彩图片

6.2 模拟研究

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

原文链接:https://arxiv.org/pdf/2602.20115v1