MICROCANONICAL LANGEVIN ENSEMBLES:ADVANCING THE SAMPLING OF BAYESIANNEURAL NETWORKS
微观正则朗之万集成:推进贝叶斯神经网络的采样方法
https://arxiv.org/pdf/2502.06335
摘要
尽管最近取得了一些进展,对于贝叶斯神经网络(BNNs)而言,基于采样的推理仍然是概率深度学习中的一个重大挑战。虽然基于采样的方法不需要假设变分分布,但当前最先进的采样器仍然难以应对BNN后验分布的复杂性和高度多模态特性。因此,即使在小型神经网络上,基于采样的推理所需的时间仍然明显长于非贝叶斯方法,尽管近年来软件实现效率已有提升。除了难以找到高概率区域的问题之外,采样器需要多长时间才能充分探索这些区域仍然不可预测。
为了解决这些挑战,我们提出了一种集成方法,结合了优化中的策略和一种新提出的采样器——微观正则朗之万蒙特卡洛(Microcanonical Langevin Monte Carlo, MCLMC),以实现对BNN高效、稳健且可预测的采样性能。与基于当前最先进“不转向采样器”(No-U-Turn Sampler, NUTS)的方法相比,我们的方法实现了高达一个数量级的速度提升,同时保持甚至提升了在多种任务和数据模态下的预测性能和不确定性量化能力。所提出的微观正则朗之万集成方法(Microcanonical Langevin Ensembles)以及对MCLMC的改进进一步增强了方法在资源需求方面的可预测性,使并行化更加容易。总体而言,该方法为贝叶斯神经网络的实际、可扩展推理提供了一个有前景的方向。
1 引言与相关文献
基于采样的贝叶斯神经网络(BNNs)推理方法作为一种有理论依据的方式,受到了广泛关注,用于解决概率深度学习中解析不可行的问题(Izmailov 等,2021;Wiese 等,2023;Papamarkou 等,2024)。一些新方法,如子空间推理(subspace inference;Izmailov 等,2020;Dold 等,2024),正在被探索,并在需要有效不确定性量化的多个领域中得到应用,包括医疗健康(Peng 等,2020)和物理学(Cranmer 等,2021)。Papamarkou 等(2022)以及 Sommer 等(2024)指出了当前基于采样的方法中存在的若干缺陷,特别是采样过程需要恰当的初始化以及难以捕捉多模态分布的问题。
采样器与问题设定: 哈密顿蒙特卡洛(HMC;Duane 等,1987)和欠阻尼朗之万蒙特卡洛(Underdamped Langevin Monte Carlo;Leimkuhler & Reich,2009)是高维采样问题的黄金标准算法。然而,它们的性能已知对超参数非常敏感,例如步长、预处理(preconditioning)以及动量退相干率(momentum decoherence rate)(Neal,2011)。因此,通常会结合自动超参数自适应算法使用。近年来发展出了一些基于集成(ensemble-based)的方案(Sountsov & Hoffman,2022;Hoffman & Sountsov,2022;Riou-Durand 等,2023),但这些方案都严重依赖于参数的集成方差来调整关键的动量退相干率超参数,在某些情况下还包括(预处理后的)步长。因此,它们并不适用于 BNN 的高度多模态后验分布。
在无梯度采样方面,也开发了多种集成算法,例如预处理蒙特卡洛(pocoMC;Karamanis 等,2022a;b)、嵌套采样(Nested Sampling;Skilling,2004)和椭圆切片采样(Elliptical Slice Sampling;Murray 等,2010)。这些算法能够应对多模态问题;然而,它们在高维设置下扩展性较差。例如,椭圆切片采样经常用于 BNNs(Izmailov 等,2020;Dold 等,2024),用于在参数空间的一个小的子空间(例如 2 维或 3 维)中进行采样,但无法扩展到更大的维度。虽然存在其他用于多模态采样的替代方法,但它们也不适合高维且高度多模态的 BNN 设置。例如,像 Grenioux 等(2024)提出的随机定位方法可以处理中等程度的多模态,但对超参数(如随机定位中的积分初始化 t0)敏感,且缺乏可扩展性。同样,Liouville Flow Importance Sampler(Tian 等,2024)提供了无偏采样,但需要训练一个神经流模型,而随着问题维度和复杂性的增加,这个模型也需要变得越来越复杂,从而限制了其可扩展性。Fan 等(2024)提出的一种路径引导粒子方法中所使用的学得向量场也是如此,附录 A.1.3 中提供了实证比较。
HMC 与 NUTS: 因此毫不奇怪,一种序列 HMC 变体——不转向采样器(NUTS;Hoffman & Gelman,2014)仍被视为“唯一一种理论上可在广泛模型类别中扩展到高维的 MCMC 算法”(Strumbelj 等,2024)。尽管 HMC 的可扩展性允许其应用于中等大小神经网络的完整参数空间,而其 NUTS 变体提供了几乎无需调参的 HMC 实现方式,但它无法充分探索 BNN 后验中存在的众多模式(Wiese 等,2023)。最近提出的 HMC 变体 Symmetric Split HMC(Cobb & Jalaian,2021)改进了 HMC 的内存可扩展性,但也带来了其他缺点,包括对超参数的敏感性。我们在附录 A.1.3 中提供了实证比较和进一步讨论。
标准先验(如各向同性高斯分布)还可能导致初始化问题,即采样器从低概率区域开始,导致收敛缓慢或陷入局部区域。为了解决这些问题,Sommer 等(2024)提出了一种贝叶斯深度集成(Bayesian Deep Ensemble, BDE),即许多经过暖启动的马尔可夫链蒙特卡洛(MCMC)链的集合。通过这种方法,作者提高了探索能力,并在常见基准任务上实现了最先进的预测性能和不确定性量化(UQ)性能。尽管通过并行化和高效实现,该方法比之前使用的方法快得多,但 Sommer 等(2024)仍然依赖于 NUTS。这带来了显著的计算负担,使得整个方法中采样阶段的计算成本仍然占主导地位。
我们的贡献
为了提高基于采样的贝叶斯神经网络(BNNs)推理的可扩展性和效率,我们识别出一种可能的、基于MCMC的替代方案:微观正则朗之万蒙特卡洛(Microcanonical Langevin Monte Carlo, MCLMC;Robnik 等,2023) 。在最近的实验中,作者展示了 MCLMC 在计算上优于 NUTS,同时在下游任务指标中提供了相同质量的样本。虽然 MCLMC 在单模态和序列采样任务中展现出比 NUTS 更好的计算优势,但在不做重大修改的情况下,它无法应对 BNN 所面临的多模态性、数值不稳定性和可扩展性挑战(例如见附录 A.1.2)。
我们将改进后的 MCLMC 作为我们方法的核心组件,其中包括:
- 用于增强探索能力的深度集成初始化(deep ensemble initialization)
- 针对高维设置中数值稳定性的调整
- 针对关键瓶颈的优化措施
最终提出的方法称为 微观正则朗之万集成(Microcanonical Langevin Ensemble, MILE) ,具备自动调参功能,且开箱即用时表现稳定可靠。大量实验表明,MILE 达到了最先进的性能,同时比以往的基于采样的方法快达一个数量级。
2 背景
2.1 蒙特卡洛采样
在基于采样的推理框架下,我们使用从后验分布(密度为 p(θ∣D))中抽取的样本,来估计式(1)中解析不可行的积分。这些样本是通过马尔可夫链蒙特卡洛(Markov chain Monte Carlo, MCMC)方法获得的,这类方法构造一个马尔可夫链,使其平稳分布为后验分布或接近后验分布。
误差分析与 Metropolis-Hastings 调整: 这种近似的误差由三项组成:初始化误差、离散化误差和蒙特卡洛误差。初始化误差是一种瞬态效应,由马尔可夫链的初始分布尚未达到平稳分布(即预热阶段,burn-in phase)所引起。蒙特卡洛误差是由有限的样本数量 S 和链的数量 K 所导致的方差。离散化误差则是由于在数值模拟采样器动力学时使用了有限步长而引起的。这会导致后验分布 p(θ∣D) 不再是马尔可夫链的平稳分布。
通常采用 Metropolis-Hastings(MH) 方法来完全消除离散化误差,但这会带来需要使用更小步长的代价。这是因为接受率(acceptance rate)依赖于能量误差平方的指数函数,而能量误差随着维度线性增长。因此,为了保持固定的接受率,当参数数量增加时,必须减小步长,从而导致采样器在高维空间中移动得更慢。
此外,如果马尔可夫链的初始分布与平稳分布相差较大,MH 算法容易出现接受率退化的问题,进而导致收敛速度变慢和较大的初始化误差(Durmus & Eberle,2023)。另一方面,如果不使用 Metropolis 调整,则离散化误差将强烈依赖于步长。因此,只要稍微减小步长,就可以使离散化误差相对于初始化误差和蒙特卡洛误差变得可以忽略。
基于上述考虑,我们在方法中选择省略 MH 调整,而是依靠谨慎的初始化和步长调优来控制各项误差。
2.2 微观正则朗之万蒙特卡洛(Microcanonical Langevin Monte Carlo)
在贝叶斯神经网络(BNN)研究领域之外,最近提出了一种新的采样方法:微观正则朗之万蒙特卡洛(Microcanonical Langevin Monte Carlo, MCLMC) 。MCLMC 采样器的时间演化(Robnik & Seljak,2024)由以下随机微分方程控制:
其中 W 是维纳过程(Wiener process),η 是一个自由参数,等价于动量退相干之前在参数空间中行进的典型长度,通常用 L 表示。Robnik & Seljak(2024)使用漂移-扩散离散化方法来数值求解方程(3)。其中的漂移部分 (即不包含最后一项随机项的方程(3))通过最小范数积分器(Takaishi & de Forcrand,2006;Omelyan & Kovalenko,2013)进行求解。
在步长 ϵ 趋于零的极限下,所得到的马尔可夫链具有后验分布 p(θ∣D) 作为其平稳分布(Robnik & Seljak,2024)。较小的步长会减少离散化误差,但也会增加蒙特卡洛误差和初始化误差,因为采样器移动得更慢。因此,我们希望将步长减小到使离散化误差小于其他两个误差来源的程度,但不要过小。
Robnik 等(2023)提出使用每维度能量误差方差(EEVPD) 来衡量离散化误差,并表明可以通过控制 EEVPD 来控制离散化误差。类似于在 Metropolis 调整算法中调整步长以匹配某个目标接受率的做法,在非调整算法中也可以通过调整步长来匹配期望的 EEVPD。这种带有偏差控制的、非精确但高效的策略,也是我们在本工作中所采用的方法。
需要注意的是,平稳分布与自由参数 η 无关,特别是即使在确定性动力学(即 η=0)的情况下也成立。这在 HMC 中并不成立,因为在 HMC 中,动量重采样对于维持所需的平稳分布至关重要。MCLMC 更具确定性的特性使其在探索阶段 (exploitation phase)能够更快地收敛。
尽管如此,参数 η 仍然很重要,因为它控制着动量退相干的速度,并迫使动力系统向参数空间中未被探索的部分移动。Robnik 等(2023)发现,当 L/ϵ 的数量级接近链的自相关时间时,可以取得良好的性能表现。由于自相关时间的评估成本较高,他们还建议通过计算参数的方差,将 L 设置为后验模态的大小。
基于这些考虑,他们提出了一个三阶段调参方案,我们现在将其称为三个阶段:
- 第一阶段(Phase I)
:调整步长以匹配目标 EEVPD,并完成预热(burn-in)过程。
- 第二阶段(Phase II)
:估计参数方差,以获得对 L 的初步估计。
- 第三阶段(Phase III)
:估计自相关时间,以进一步优化 L 的估计值。
3 微观正则朗之万集成(Microcanonical Langevin Ensembles)
为了将 MCLMC 嵌入一个稳健的采样流程 (见图1),使其在 BNN 中有效工作并利用集成的思想,我们将在下文中讨论优化技术与采样的结合,以及对 MCLMC 所需的各种修改。如果没有这些改进,MCLMC 在探索能力方面会遇到困难,并表现出较高的失败率,尤其是在高维设置中(参见附录 A.1.2)。
3.1 利用集成减少初始化误差
如第 2.1 节所述,预测后验近似中的误差可以分解为三个部分。虽然第 2.1 节将初始化误差描述为一种“瞬态效应”,但不应因此误认为它不重要;在 BNN 应用中,特别需要重视这一误差的处理。与大多数其他采样器一样,MCLMC 很有可能陷入 BNN 高维且高度复杂的后验分布中的低概率区域。因此,我们提出的解决方案是将采样与优化步骤相结合 (图1中蓝色部分)。
为了防止采样阶段的链被初始化到这些不利区域,我们运行 K 次优化步骤,为每个 k∈[K] 的链获得起始值 θ∗(k)。作为副产品,我们得到了一个包含 K 个成员的深度集成(Deep Ensemble, DE;Lakshminarayanan 等,2017) 。与 Sommer 等(2024)的研究一致,我们发现使用经过优化的神经网络作为初始值可以显著减少该误差,并防止采样器陷入局部区域。
3.2 调参阶段的改进
在上一小节中,我们提出通过运行一组 MCLMC 链来优化使用 MCLMC 时的起始值。然而,仅对每条链的初始值进行优化还不足以使 MCLMC 在 BNN 中数值稳定且高效地工作(参见附录 A.1.2)。因此,我们讨论将 MCLMC 应用于 BNN 时需要进一步调整的三个调参阶段组件,并提出了与尺度相关 的对 MCLMC 第三阶段的修改。
步长(Step size)
Robnik 等(2023)建议将步长 ϵ 初始化为 d (其中 d 是参数维度)。虽然这一默认设置在他们的应用中表现良好,但对于相对较小的神经网络来说,这个值已经过大。过大的步长会导致能量发生显著变化,从而引入严重的数值问题。由于 MILE 的链已经从高概率区域初始化,因此明显减小 ϵ 是合理的。在实践中,这意味着我们可以将步长设置为 MILE 优化阶段中优化器所使用的学习率 。除了减少初始的离散化误差外,这种做法还能确保在预热阶段早期以及接近优化解的位置进行更局部化的探索,同时随着调参过程的推进允许更大的步长(这一点也可以通过实验证实)。
能量方差调度器(Energy variance scheduler)
MILE 第一阶段的另一个调参参数是能量方差调度器 ,它控制着“探索”与“开发”的权衡。在已经优化了 K 个起始值的前提下,MILE 不需要过多的开发阶段,而每个 MCLMC 链应更专注于“开发”。与 Robnik 等(2023)提出的固定目标能量方差策略不同,我们采用一个线性调度器 :从较高的目标能量方差开始,并逐步降低。这样做可以在预热阶段初期促进更具噪声的探索,在后期则加强开发能力。
在集成中的多个链上并行执行此操作后,我们的方法类似于 SG-MCMC 采样中流行的“循环学习率”策略(Zhang 等,2020)。但与经历多个探索-开发阶段不同的是,我们为每条链只执行一次探索-开发周期,并将这一策略进行并行化。
有效样本量(Effective sample size) MCLMC 还需要在 EEVPD(每维度能量误差方差)估计阶段设定所需的 有效样本量 (ESS)水平。虽然这一水平通常由实践者和可用计算资源决定,一个可行的选择是将 ESS 设为总后验样本数的 10%。由于之前基于 NUTS 的方法也报告了约 10% 的 ESS 比例,因此这一数值可以保证与 NUTS 相当的样本质量。 第三阶段瓶颈(Phase III bottleneck)
当将 MCLMC 调参算法扩展到更高维度时,第三阶段存在一个计算瓶颈,即估计经验有效样本量(ESS),这一过程是通过快速傅里叶变换 (FFT,Bracewell & Bracewell,1986)完成的。FFT 是对所有样本中的每个参数分别进行计算的。尽管高效的实现方式在时间复杂度上可以达到 O(SlogS),但在维度和样本数量增加的情况下,这仍然会显著影响运行时间。因此,我们建议在维度 d>2000时对参数进行子采样 (subsample),从而线性地减少运行时间。我们还建议对样本进行稀释处理(thinning),使得用于 FFT 计算的样本数量上限为 。
3.3 有效的计算资源分配(Effective Computational Budget Allocation)
由有限样本数和链数引起的第三种误差是蒙特卡洛误差 。与 NUTS 不同,NUTS 对每次提议使用不同数量的蛙跳步长(leapfrog steps),并且每一步都需要一次梯度计算,而 MCLMC 使用一种确定性的方法,由于采用了最小范数积分器,每个样本需要两次梯度计算。这种结构使得 MCLMC 的计算需求更加可预测,带来了显著的实际优势。
相比之下,NUTS 所执行的步数在任务内部和任务之间都可能表现出较大的差异,导致实践中通常会为蛙跳步数设置一个上限。借助更可预见的计算需求,我们可以在给定计算预算的前提下,优化 MILE 中链的数量与样本数量之间的平衡,以最小化蒙特卡洛误差。
正如最近的研究所示,在简单问题中,MCLMC 在获取有效样本方面可以远比 NUTS 高效。因此,我们建议从每条链中采集相对较少的样本,从而限制 MCLMC 在探索单个局部模态上所消耗的计算资源,并依赖深度集成(DE)来进行全局探索。
预热阶段(Warmup stage)
不建议直接从 DE 优化后的点开始采样链,因为这些模态并不与所谓的“典型集合”(typical sets;Betancourt, 2018)重合。我们建议为 MILE 的预热阶段分配 40,000 步 ,即 80,000 次梯度计算 。相比于在 BNN 任务中通常需要超过 90,000 次蛙跳步/梯度计算的 NUTS,这是一个较为保守的下限。
随后进行第二阶段和第三阶段,各分配 5,000 步 ,以确保对动量退相干尺度 L 进行稳健估计。
采样阶段(Sampling stage)
由于 MCLMC 样本之间存在显著的自相关性,我们可以通过稀释采样 (thinning)进一步减少内存开销,且不会显著降低样本质量,只要稀释的成本相对于整体采样时间可以忽略,就不会增加推理时间。
在我们的设定中,在完成 50,000 步预热后,我们建议为采样阶段分配 10,000 步 。稀释间隔的选择则基于内存和推理时间的限制,即后验样本预算。
在本研究中,我们探讨了两种场景:一种是每条链有 1,000 个样本,另一种是每条链有 100 个样本,分别对应稀释间隔为 10 和 100。总体而言,我们建议每条链采用固定的 60,000 步预算,以提供一个可预测的采样过程。通过适当调整稀释策略,还可以进一步有效地管理内存和推理时间需求。
4 实验
在本节中,我们评估将 MILE 应用于贝叶斯神经网络(BNN)基于采样的推理的可行性。
数据集与模型 :我们复现了 Sommer 等(2024)的基准测试,并进一步将其扩展到其他数据集(Ionosphere、Income、IMDB、MNIST、F-MNIST)以及不同类型的模型(卷积神经网络和基于注意力机制的神经网络)。
方法 :与 Sommer 等(2024)一致,我们研究了所提出的方法相较于深度集成(DE)的改进效果,同时也将其与当前最先进的基于 NUTS 采样器的 BDE 方法进行了比较。
运行时间对比 :在此基础上,我们进行了一系列消融实验,细致地考察了 MILE 相对于 BDE 的可扩展性表现。
调参与超参数 :最后,我们验证了 MILE 超参数的鲁棒性,支持我们的观点,即 MILE 是一种像 NUTS 一样可自动调参、开箱即用的推理过程。
实验设置及其实现细节见附录 A.2。所使用的诊断方法和评估指标详见附录 A.3 和 A.4。
4.1 基准测试(Benchmarks)
本节的目标是展示以下三点:
1)MILE 在贝叶斯神经网络(BNN)设置中的可行性;
2)其在预测性能(使用均方根误差 RMSE 或准确率 Accuracy 衡量)方面的优越表现,以及在不确定性量化(UQ)方面(使用对数伪边缘似然 LPPD 衡量)的提升;
3)其在运行时间上的改进。
4.1.1 UCI 基准测试
我们使用 Sommer 等(2024)中曾用于基于采样的推理研究的六个 UCI 数据集,并采用具有两个隐藏层、每层 16 个神经元的 ReLU 网络复现他们的基准测试(详见附录 A.2)。我们将当前最先进的 BDE 方法和 DE 基线方法的预测准确性、不确定性量化(UQ)以及运行时间与 MILE 进行对比。MILE 的配置如第 3 节所述。
性能结果 :表 1 展示了实验结果,表明 MILE 在预测性能和不确定性量化方面始终能够达到或优于其他方法,同时显著降低了计算成本。这一点在较大的数据集上尤为明显,例如 bikesharing(B)和 protein(P)数据集上,MILE 的采样速度比 BDE 快近十倍。
在大多数情况下,DE 优化之后的 MCLMC 采样阶段的耗时与 DE 的拟合阶段本身相当。值得注意的是,这对于基于采样的推理方法而言是一个重大进步——它实现了与 DE 相当的时间复杂度(约为 DE 的 2 倍运行时间),同时提供了更优且更具理论依据的不确定性度量。
资源可预测性 :如前所述,MILE 的高效性源于其更少的梯度计算次数以及可预测的运行时间。与 BDE 不同的是,在 BDE 中由于 NUTS 所采用的蛙跳步数具有高度可变性,导致其运行时间波动较大;而 MILE 使用固定的步数,因此在已知单次梯度计算成本的情况下,可以轻松预测整体运行时间。这对于像贝叶斯神经网络后验采样这样计算成本高昂的任务尤其重要。
图 2 展示了 BDE 在生成 1000 个后验样本时,无论是在同一任务内部还是不同任务之间,其计算成本都存在显著的波动。这种波动往往超过了 MILE 中整个采样阶段的预算。此外,在并行计算环境中,BDE 的性能受限于耗时最长的那条链,而 MILE 的确定性特性确保了在并发采样中能够实现完美的负载均衡(参见第 3.3 节)。
诊断分析 :为了进行诊断并评估 MILE 和 BDE 所生成样本的质量,我们计算了有效样本量(ESS,Vehtari 等,2021)以及链间的 4 分割 cRc 指标(Sommer 等,2024)。从图 6a 和 6b 中可以看出,MILE 在采样质量和局部混合效率方面也优于 BDE,表现出更高的平均 ESS 和更小的 cRc 值。
4.1.2 扩展基准测试(Extended Benchmarks)
除了现有的基于采样的推理基准之外,我们还将分析扩展到更复杂和更大规模的模型,展示了 MILE 在卷积神经网络(CNN)、分类任务以及跨不同数据模态的序列模型中的成功应用(详见附录 A.2)。
我们之所以能够推进现有基准测试的主要原因,在于使用 MILE 对这些任务进行采样是可行的。相比之下,如果使用 NUTS 进行推理,所需时间可能长达数周。因此,我们在实验中主要将 MILE 与 DE 基线进行比较,并在附录中为较小的模型提供 NUTS 的结果。此外,我们还报告了单个 DE 成员和单条 MCMC 链的平均性能,以突出集成所带来的额外优势。
结果 :表 2 中展示的结果不仅证实了 MILE 在准确性和不确定性量化(UQ)方面优于 DE 基线,还表明其在更大规模的模型和新的问题领域中也表现出性能提升,进一步验证了 MILE 所采用的额外探索步骤带来的积极影响。
4.2 消融实验:模型复杂度与运行时间
UCI 基准测试清楚地展示了 MILE 相较于 BDE 在运行时间方面的优势。为了进一步研究模型复杂度(参数数量)和数据集大小对运行时间的影响,我们进行了两项消融实验。
模型复杂度的扩展性分析
图 3 展示了随着模型复杂度增加,所需采样时间和性能指标的变化趋势。对于一个维度为 5,426 的情况,MILE 可在 30 分钟内完成采样,而 BDE 则需要数小时。更引人注目的是,MILE 不仅保持更快的速度,而且其相对于 BDE 的性能优势随着模型复杂度的提高而进一步扩大,这表明 MILE 在效率和高维性能方面都具有显著优势。
为了量化时间复杂度,我们拟合了一个线性化的幂律模型来估计采样时间随参数数量 d 增长的趋势:
值得注意的是,从视觉上看,BDE 的扩展性可能比二次函数更差,但为了与 MILE 的拟合方式保持一致,我们采用了保守的二次项拟合。整体来看,这种扩展行为非常接近幂律关系,而观察到的 n 上的二次趋势很可能源于随着数据集增大带来的内存相关硬件性能下降。
4.3 消融实验:超参数鲁棒性
为了验证我们提出的 MILE 中 MCLMC 配置确实是一种稳健且可自动调参、开箱即用的方法 ,我们进行了一系列消融实验。具体来说,我们按照第 3 节中建议的方式改变了 MILE 的默认超参数,并考察这些变化对性能的影响。
在每一次消融实验中,我们系统地评估方法的鲁棒性,通过在合适的网格上逐一改变单个超参数来进行测试。我们不仅报告了这些超参数变化对保留测试集性能指标的影响,还记录了采样器关键参数(动量退相关尺度 L 和步长 ϵ)的相应调优结果。
虽然这些超参数变化对 L 和 ϵ 的影响也很有趣,但我们的主要关注点是找到能够带来稳健且良好性能表现 的参数估计值。作为对比,我们还展示了 BDE 方法和 DE 基线方法的性能。
实验结果 结果汇总于图 4 中。在所有测试案例中,MILE 始终表现出良好的鲁棒性,对超参数的变化几乎不敏感。主要参数 L 和 ϵ 的变化总体上都很小,尤其是对性能影响较大的 ϵ 的变化非常微小,因此并未显著影响整体性能。
一个例外是预热阶段(warmup)的预算设置:当大幅延长预热阶段时,可以观察到轻微的性能提升。然而,这种提升非常有限,且伴随着运行时间的线性增长,因此额外的计算成本并不划算。
综上所述,这些结果支持了这样一个结论:MILE 在本质上是无需手动调参 的。因为在所考虑的情况下,其性能不会因不同超参数而发生剧烈变化,且在默认设置下已经接近最优表现。
这种鲁棒性确保了实践者可以在无需大量调参的前提下自信地使用该方法 ,从而进一步增强了其实际应用价值。
5 讨论
在本研究中,我们提出并评估了一种用于贝叶斯神经网络后验采样推理的方法——微观正则朗之万集成(Microcanonical Langevin Ensembles, MILE)。通过改进一种新提出的 MCLMC 采样器,并将其与通过深度集成(Deep Ensembles)获得的初始值相结合,我们的对比分析表明,与基于 NUTS 的方法相比,MILE 在性能、样本质量、不确定性量化(UQ)以及运行时间方面均实现了显著提升。此外,由于 MILE 具有确定性的梯度计算次数,其资源需求更加可预测,也更易于并行化。
综上所述,我们所提出的方法可以被视为一种可靠且高效的开箱即用方法 ,是实现采样-based推理在通用贝叶斯神经网络中可行化的重要一步。
本研究的范围与局限性 尽管 MILE 在处理高维数据集时也能带来显著的运行时间节省,但本研究的主要目标是克服基于 NUTS 的集成方法最突出的瓶颈:其在参数数量上的不良扩展性,以及由于梯度计算次数多变且庞大而导致的资源分配不可预测的问题。由于 MCLMC 及其改进版本似乎已成功解决了这些问题,因此我们认为下一步的研究方向(在本文中未进行比较)应转向 随机梯度采样器变体 (Stochastic Gradient Sampler Variants)。虽然这种转变通常并不简单,但它将克服当前采样-based推理的另一个主要限制:在大规模数据集上的可扩展性问题。
此外,我们未在本研究中探索的 MILE 的另一个可能改进方向是使用替代先验分布 ,例如 Fortuin 等(2022)中讨论的那些先验。
原文链接:https://arxiv.org/pdf/2502.063
热门跟贴