立场:采样时代已至——为贝叶斯深度学习开辟新航向

Position: The Time for Sampling Is Now!

Charting a New Course for Bayesian Deep Learning

https://arxiv.org/pdf/2605.21765

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

摘要

基于采样的推断(SAI)在贝叶斯神经网络(BNN)中的实际应用仍然有限,部分原因在于人们对采样可行性和效率的持续误解。本立场论文认为,SAI已在计算效率上与基于优化的方法达到同等水平,并且即将超越这类方法,成为BNN中有效且高效的推断手段。这一进展应当引起整个学术界的关注,因为它将推动BNN作为一种原则性范式,兑现其长期以来未能实现的承诺——为神经网络提供有原则的不确定性量化。SAI甚至能做得更多——通过模型平均带来更优的预测性能,为众多可能的下游任务奠定基础,并为理解BNN的损失景观提供关键洞察。为了实现这一转变并释放采样的潜力,克服当前的误解是必要的第一步。下一步则是将研究重心重新调整到解决SAI尚存的挑战上。具体而言,学术界必须聚焦于两个核心问题:对后验景观的充分探索,以及对后验样本的高保真蒸馏,以实现高效的下游推断。通过解决概念性和实践性障碍,我们能够释放SAI的全部潜力,并将其确立为贝叶斯深度学习的核心工具。

1. 引言与动机

随着基于深度学习系统在科学和工业领域的广泛应用(例如 Eraslan 等,2019Abramson 等,2024),捕获这些系统认知不确定性的需求也在不断增长(Hüllermeier & Waegeman,2021;Murphy,2023)。贝叶斯深度学习(BDL)通过模型后验分布为捕获这种不确定性提供了原则性框架,并催生了针对神经网络的各种近似方法(Papamarkou 等,2024)。

当代BDL研究主要遵循两个方向。一个分支聚焦于基于采样的推断(SAI),强调渐近保证,同时避免依赖简化的分布假设,但局限于小规模问题(Cobb & Jalaian,2021;Wiese 等,2023)。另一个分支将后验求解重新定义为优化问题,优先考虑可扩展性和速度,但代价是采用更刚性的近似(Blei 等,2017;Daxberger 等,2021a;Shen 等,2024)。

然而,SAI的最新进展表明,采样方法在更大规模问题上同样具有计算可行性,且在经验和不确定性估计方面往往优于近似方法(Deng 等,2023;Paulin 等,2025;Sommer 等,2025)。作为这些方法学进展的补充,诸如 blackjax(Cabezas 等,2024)和 posteriors(Duffield 等,2025)等软件框架现已提供更快且更易获取的核心采样算法实现。

鉴于上述发展,我们提出如下立场:基于采样的推断是贝叶斯深度学习的新未来,但我们需要重新思考研究重点和推断工作流。我们主张,在超越日益狭隘的算法改进追求之后,该领域的进展现在取决于协同努力,以构建鲁棒且可访问的端到端工作流。这需要:

  1. 解决当前阻碍采样方法更广泛接受和使用的持续误解。

  2. 开发更有效的策略来探索神经网络复杂的后验景观,利用并行化和优化方面的洞见。

  3. 优先关注管理后验样本这一尚未充分探索但至关重要的领域,包括跨各种任务的有效存储、蒸馏和重用。

图1直观概述了现状、算法推动因素、工具以及我们提议的SAI转向所能释放的变革潜力。在本文剩余部分,我们将通过以下方式阐述这一观点:(1)澄清关于SAI的常见误解;(2)概述可扩展后验样本生成的关键设计原则和开放挑战;(3)研究重点也应如何转向开发实用的推断新方法。

打开网易新闻 查看精彩图片

2. 背景

2.1. 贝叶斯神经网络

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

近似贝叶斯推断为了规避精确后验的难处理性,近似贝叶斯推断(ABI)方法通常将问题转化为一个简单得多的优化问题,其近似通常围绕该后验的(局部)最大后验(MAP)估计量展开(参见,例如,Blei等,2017)。由于后验通常无法以解析形式获得,寻找(局部)最大化器需要简化假设。使问题可解的常见方式有变分假设,即不再最大化真实后验,而是使用具有更简单结构(例如因子化高斯分布)的代理后验(Ranganath等,2014),或者假设一个优化的神经网络即为MAP估计量,并围绕该点进行局部近似。常用方法包括拉普拉斯近似(Daxberger等,2021a)、子空间推断(Izmailov等,2020;Dold等,2025)和随机权重平均(Izmailov等,2018)。在实践中,由独立初始化并优化的网络组成的集成,即深度集成(DE,Lakshminarayanan等,2017),构成了近似预测不确定性的强有力且鲁棒的基线,尽管仅在特殊情况下才是对后验的有效近似(Wild等,2024;Rügamer,2026)。其贝叶斯扩展将在本工作中讨论。

2.2. 基于采样的推断

打开网易新闻 查看精彩图片

3. 持续存在的误解与近期进展

核心采样方法和高效实现方面的近期进展已大大缓解了先前存在的许多障碍。这些进展使得SAI在时间复杂度和可扩展性方面可与基于优化的近似推断方法相媲美,同时实证上展现出更优越的性能(例如,见图2)。尽管取得了这些显著进展,关于SAI的持续误解已超出了对计算低效的刻板印象。许多这些挥之不去的观念源于将经典MCMC技术简单移植到BNN这一独特语境中。以下讨论针对学术界普遍存在的最相关误解,特别是关于时间复杂度、可扩展性、先验选择、(未)调整采样以及“冷后验效应”等。

打开网易新闻 查看精彩图片

时间复杂度一种普遍看法是SAI非常缓慢,使其在实践中不可行。然而,近期贝叶斯与非贝叶斯深度学习方法之间的比较(参见,例如,Sommer等,2025;2026a;Arvanitis等,2026;Paulin等,2025;Deng等,2023)表明,一旦为每条链确定了良好的起始值,采样时间大致与初始优化步骤相当。与此前使用较不先进的方法和软件时采样成本高出10倍或100倍的情况相比,这清楚地标志着一个转折点。鉴于采样成本与优化相当,大多数从业者很可能愿意并且能够花费这些额外时间。即使竞争方法被给予相同甚至更多的计算预算,采样仍能提供显著更好的性能时,这一点尤其成立,如图2所示。

可扩展性学术界的另一种看法是采样技术无法扩展到高维问题。然而,大量采样器已在高维BNN中证明了其有效性(Welling & Teh,2011;Chen等,2014;Springenberg等,2016;Zhang等,2020;Paulin等,2025;Sommer等,2026a)。尽管当前SAI的使用场景通常仅涉及数百万参数,但我们认为扩展到更大模型是可行的。关键不仅在于算法进步,还在于它们与有效探索技术(第4节)和样本管理策略(第5节)的协同结合。

先验选择另一个典型例子是标准各向同性高斯先验。虽然常被视为无意义且过于简单的默认选择,但近期研究表明,在过参数化情况下它可能具有理想的正则化特性,可能有助于产生与频率派深度学习中所利用的隐式偏差类似的效果(Fortuin,2022;Tran等,2022;Kobialka等,2026)。此外,与这些反复出现的担忧相反,近期多篇论文已表明,在使用这些简单权重先验时,BNN取得了最先进的性能(Kobialka等,2026;

Paulin等,2025;Kim等,2024)。鉴于独立的权重初始化在基于优化的方法中也是一个行之有效的概念,我们认为先验是BDL中合理且合适的选择。

Metropolis-Hastings调整虽然基于随机梯度的采样器中的离散化误差已受到相当多的关注(Cobb & Jalaian,2021),但它通常代表近似误差中次要的来源。这突显了在实用BNN设置中特有的偏差-方差权衡。虽然在通用MCMC中严格消除离散化误差(通常通过Metropolis-Hastings调整)是确保细致平衡的标准做法,但在高维中这样做会导致极低的接受率,从而在任何现实的计算预算下产生巨大的蒙特卡洛误差。因此,在实际情况下,当使用足够小的步长时,初始化误差和样本不足带来的蒙特卡洛误差通常主导离散化偏差(Neal,1992;Roberts & Tweedie,1996;Welling & Teh,2011;Robnik & Seljak,2024b;Robnik等,2025;Sommer等,2025)。此外,在BNN推断等高维场景中,采样路径被限制在局部区域内,进一步降低了精细离散化控制的重要性。虽然控制离散化保真度对于确保高效采样是必要的,但严格调整离散化偏差不会是解锁SAI在高维中全部潜力的关键,正如Bieringer等(2023)、Garriga-Alonso & Fortuin(2021)所建议的,并且对于某些采样器,可以采用特定的调参以可扩展、轻量的方式保持低离散化误差(Sommer等,2026a)。

关键设计选择的交互作用许多误解之所以存在,是因为采样方法核心设计选择之间的交互作用被忽视了,例如先验设定、采样器噪声注入以及由此产生的后验收缩。例如,经典的偏差-方差权衡——过大的噪声导致有偏估计,而过小的噪声导致探索不足——已经在理论和实践中得到讨论(Wenzel等,2020;Robnik & Seljak,2024a)。然而在BNN的背景下,诸如先验、数据增强和采样方案等关键组成部分往往被孤立地研究。例如,感知到的“冷后验效应”——即后验退火提升性能——最初被假设与似然和先验之间的不匹配有关。然而后来研究表明,这种效应很大程度上可归因于数据增强和分类设置中似然选择之间的交互作用未得到充分重视,而非目标分布本身有缺陷(Wenzel等,2020;Izmailov等,2021;Bachmann等,2022;Kapoor等,2022)。

通过厘清这些设计选择并超越过时的误解,学术界可以聚焦于SAI的核心优势,其中包括忠实的量化不确定性、为下游任务提供原则性基础,以及对BNN后验更深层次的结构性洞察。

4. 贝叶斯神经网络的可扩展采样

基于前述基础和该领域的近期发展,以下概述我们关于在贝叶斯神经网络中实现鲁棒、有效且可扩展采样的最重要未来方向的立场。

4.1. 灵活探索优于限制性近似

BDL研究应聚焦于后验空间的高效灵活探索而非完善那些使用刚性假设将贝叶斯推断转化为优化问题的后验近似方法

BDL学术界似乎日益两极分化:一方面,研究者追求复杂但计算密集的方法,这些方法仅能扩展至小规模问题;另一方面,处理大规模问题的从业者往往依赖过于限制性的近似,例如完全因子化的变分族。近期发展引入了特定的归纳偏置以应对狭窄的子问题,但往往缺乏通用性或可扩展性。已有技术如对抗性优化被提出以将推断导向更平坦的极小值(Lim等,2025),在此类区域近似可能更为忠实。然而,近期实证研究表明,与SAI相比,此类近似在预测性能和不确定性量化方面仍有不足(Kobialka等,2026)。

尽管存在局限性,近似贝叶斯推断仍然是主导范式,很大程度上归因于其熟悉性和实现上的简便性。然而,改进越复杂,这些方法在实践中被采用的可能性就越低,尤其是当它们引入额外超参数或需要精心调参时。因此在实践中,此类方法往往仅以其最基本的形式被使用(参见,例如,Kaiser等,2025)。这突显了重新调整BDL研究优先级的必要性:与其在限制性空间内进行优化,我们倡导开发保持完整后验灵活性的可扩展SAI方法。SAI避免了变分族的结构性限制,并提供了真正灵活认知不确定性量化的潜力。

此外,我们主张在既具有实际相关性又在计算上可控的问题上,对近似推断方法进行更具战略性的评估。学术界不应在仅有数十个参数的玩具模型上进行基准测试,也不应诉诸仅能进行粗略近似的十亿级模型,而应探索中间地带:现代中型架构,其中可扩展且灵活的推断既是必要的也是可行的。该范畴的具体例子包括ResNet、Vision Transformer以及大语言模型(LLM)微调适配器,参数量从数十万到数千万不等(参见,例如,Paulin等,2025;Duffield等,2025;Sommer等,2026a)。如表1所总结,这一新兴证据提供了令人信服的概念验证,表明SAI在此规模下不仅是可行的,而且能够持续优于替代的、纯基于优化的近似方法以及强基线,如随机权重平均(SWA)、拉普拉斯近似、变分推断和深度集成(DE)。

打开网易新闻 查看精彩图片

4.2. 并行化探索是关键

高效的高维采样应将探索阶段并行化,并利用优化技术快速接近典型集,而非依赖低效的序贯探索方案。

已知神经网络的后验分布是复杂且高度多模态的(Sommer等,2024;Izmailov等,2021)。为提升采样器的探索能力,已有多种策略被提出——从退火Langevin动力学(Welling & Teh,2011;Li等,2023)到随机梯度Langevin动力学中的循环步长(Zhang等,2020)。这些方法通常旨在通过粗略近似和精细近似阶段的交替,在序贯设置中增强探索。然而在高维场景中,由于自相关增加,序贯探索变得越来越低效(Papamarkou等,2022)。虽然早期奠基性研究受计算限制,仅能探索少量序贯链(Izmailov等,2021),但近期针对完全相同模型类的研究,则显著更加强调并行探索的必要性和优点(Marek等,2024)。特别是,近期工作表明,与纯序贯方法相比,并行的、优化驱动的探索提供了更优越的计算性能和采样质量(Deng等,2023;Rundel等,2025;Duffield等,2025;Sommer等,2025;Paulin等,2025)。深度集成(DE)已凸显了并行和独立探索的优势(Lakshminarayanan等,2017;D'Angelo & Fortuin,2021),并长期以来被视为认知不确定性量化的最先进方法之一。

虽然DE并不构成有效的后验近似(Wild等,2024),但它们可以为基于采样的推断提供鲁棒且计算高效的热启动(Sommer等,2024;2025;2026a)。此外,基于优化的方法和概念正越来越多地被整合到采样流程中,在导航复杂后验景观方面实现了更高的效率(Springenberg等,2016;Bieringer等,2023;Leimkuhler等,2025)。例如,Paulin等(2025)表明,增加并行链的数量可降低对局部近似误差的敏感性,证实了基于采样的推断中的主要瓶颈未必是设计更好的采样器,而是缺乏可扩展的探索策略。

我们认为,并行的、优化知情的探索对于有效的基于采样的推断至关重要。特别是,由稳健优化技术引导的快速初始探索阶段,使得链能够在典型集有意义的邻近区域内启动,从而实现高效且可靠的采样。

4.3. SG-MCMC尚未被充分发掘的潜力

SG-MCMC的潜力在很大程度上仍未得到开发,受限于关于实际算法配置的经验指导不足。

尽管高效且可扩展的随机梯度SG-MCMC实现日益增多,例如posteriors(Duffield等,2025)、Fortuna(Detommaso等,2023)、JaxSGMC(Thaler等,2024)和SGMCMCJax(Coulon & Nemeth,2022),但这些方法仍然难以部署。特别是,所有SG-MCMC方法都对许多不同的超参数高度敏感,例如批次大小、步长或噪声水平。即使是自适应策略,如Springenberg等(2016)为SG-HMC提出的那些,也只能提供部分缓解。

为了充分实现SG-MCMC在其各种变体中的潜力——从过阻尼动力学(Ma等,2015)到并行回火(Deng等,2023),再到无阻尼采样器(Sommer等,2026a)——该领域必须投资于大规模实证研究,并促进调参经验以及SG-MCMC失败模式的开放共享。学术界不应将配置视为黑箱技艺,而应协同开发针对特定问题场景的透明启发式方法和最佳实践。

5. 高效且易用的推断

我们坚信采样可以扩展到大规模深度学习问题。然而,这仅是成功的一半,如图3中最先进BNN的推断成本比较所示。如果研究不开始探索高效存储、蒸馏和重用后验样本的方法,那么即使是最复杂的采样程序,若所获信息无法被高效且有效地利用,也不会被从业者采用。

打开网易新闻 查看精彩图片

5.1. 先存储,后改进

保存样本需要前期成本来保留所有信息,但这是必要的,且仅需廉价的硬盘存储。这应优于简单粗暴的稀疏化(thinning)策略。

管理采样存储和计算开销的一种常见但次优策略是稀疏化(Duffield等,2025;Kim等,2024;Izmailov等,2021),这一点在经典贝叶斯MCMC中日益被认识到(Riabiz等,2022)。我们认为,除了在线方法必不可少的超大规模BNN之外,默认做法应是存储大部分或全部生成的样本。随后可应用高效的后采样蒸馏技术来减少存储和/或加速推断,从而保留那些通过不加区分地稀疏化而丢失的宝贵信息。我们认为,后验样本的最优使用方式取决于下游任务和所关注的评估指标(例如,均值预测所需的样本数量与准确的尾概率估计不同,且可能样本也有所不同)。因此,SAI学术界应避免简单稀疏化和仅关注单一评估指标的做法。

此外,保留一组全面的后验样本为分析采样器动力学和评估(局部)收敛性提供了宝贵数据。由于BNN迫切需要量身定制的评估框架(Rönning等,2025),更多样本的可用性有助于更深入地理解和更精确地量化这些方面,从而直接助力采样器的开发。

5.2. 更高效的存储与推断

蒸馏后验样本将是大幅提升推断效率的关键策略,同时还能增强下游性能和校准质量。为支持这一点,学术界应构建后验样本的基准集合,以促进可重复性和实证进展。

推断时的低效不仅仅是一个计算上的麻烦。一旦建立了高效的采样流程,它就是关键的实际瓶颈。对于每一批新数据,我们需要对每个生成的后验样本执行一次前向传播,这些样本也需要在内存中可用。尽管这可以轻松并行化,但我们在图3中显示,即使采用并行化,现代采样BNN的推断成本可能比普通神经网络或完全线性化方法(Li等,2025)高出多达1000倍。这甚至还未考虑如果所有样本无法同时保存在内存中时的内存访问和I/O开销。

依赖无原则且无信息的方法(如稀疏化)会不加区分地丢弃样本,且无法解决后验样本中冗余的根本原因。因此,SAI中下一个重要的研究方向是如何将后验样本的蒸馏作为一个事后优化阶段,将一大组后验样本压缩为一个更小、信息更丰富的集合。这一过程可以同时减少测试时所需的前向传播次数,并通过隐式地重新加权或总结后验的重要区域来提升预测质量。此类方法因此也能应对自相关和模式不平衡的问题。

后验样本蒸馏的方法与具体采样器无关,可以通过多种技术来实现,包括经典数据压缩、序贯检验(参见,例如,Sommer等,2026b)、权重空间中的学习生成代理(参见,例如,Park等,2025),或有原则的子采样/重要性采样策略。这些方法补充了基础采样器,并直接针对实际BNN推断中的主要成本驱动因素:测试时处理大量网络实例。此外,此类技术可以根据下游用途(如校准质量)专门针对广泛多样的目标和指标进行定制。

除事后后验蒸馏外,贝叶斯核心集(Huggins等,2016)或数据集蒸馏(Wang等,2018)等技术可以大幅减少每一步梯度的计算负担。这对于扩展经典全批次MCMC的可行范围尤其有利,并有助于弥合其与上述SG-MCMC方法之间的差距。

我们进一步建议学术界开发一种标准化的后验样本收集方式,作为测试后验采样和蒸馏方法性能的基准。

5.3. 更智能的贝叶斯模型平均

智能聚合与平均方案不仅能提升效率,还可能带来显著的性能提升

近期研究结果表明,即使是利用集成后验采样的少量贝叶斯深度集成,也能超越规模大得多的深度集成(DE)的性能(Kobialka等,2026),如图2所示。这一优势源于有意义且灵活的局部探索,而非集成本身的规模大小。

深度集成的有效性不仅源于集成本身,更在于它们在训练过程中能够平衡探索与利用。深度集成也能产生多样化的解集,这些解在平均后形成了对BMA的有力近似。然而,标准MAP集成会迅速饱和,且缺乏原则性的加权方式和局部不确定性感知(Wild等,2024;Wang & Wang,2025)。子空间推断(Izmailov等,2020;Dold等,2024;2025)或基于SWA的初始化(Izmailov等,2018;Paulin等,2025)等方法进一步支持了以下观点:更好地利用由后验结构引导的多样性,能够带来更强的泛化能力和更可靠的不确定性。

这些发现表明,SAI中BMA的潜力远未耗尽,即使是像样本加权这样直接简单的扩展,也提供了进一步提升预测质量和校准水平的途径(Yao等,2022;Sheinkman & Wade,2025)。

5.4. 软件

采样后阶段,即后验蒸馏、服务部署和共享,需要专门的工具支持,以释放基于采样的贝叶斯推断在神经网络中的全部潜力。

尽管后验采样近期取得了进展,但周边的生态系统缺乏针对可扩展贝叶斯神经网络需求量身定制的成熟端到端工具。与成熟的经典贝叶斯建模框架(PyMC;PyMC-Devs,2025)或通用深度学习框架(如Keras(Chollet等,2015))相比,从业者在获取高性能模块化工具来管理大型后验集合并处理后用于下游部署方面,途径非常有限。

我们倡导构建高性能库,集成模块化设计、自动优化和原则性默认行为。这些工具应优先考虑模型服务效率,并具备处理后验蒸馏流程的能力。核心采样库的近期发展(参见第1节)提供了基础,但还需要更广泛的基础设施。例如,一个高效流水线应利用异步回调,将样本及时保存到磁盘。这种方法几乎不产生相关的I/O开销,并能防止内存累积,从而在不以信息损失为代价采用过于激进的稀疏化间隔的前提下,充分利用硬件加速器。

此外,像ArviZ库(Kumar等,2019)这类限于经典贝叶斯模型和诊断的软件,应扩展以适用于BNN用例。目前在BNN研究中依赖经典收敛诊断的做法——无论是在参数空间(例如,Jawla & Kelleher,2025)还是函数空间(例如,Andrade & Sato,2024;Fortuin,2022)——往往存在问题:参数空间诊断对不可识别的BNN没有信息价值,而函数空间指标可能助长误导性的同质化(Sommer等,2024)。开发更好的、针对BNN收敛的量身定制评估框架仍然是一个开放且高度相关的问题。

像huggingface那样的标准化接口用于后验样本共享,将进一步促进可重复性、实证基准测试和社区驱动的进展。使后验样本可访问、可比较且可高效部署,是采样式贝叶斯深度学习走向主流应用的必经之路。

6. 不同观点

在结束我们的立场陈述之前,我们简要列举一些在关于SAI实用性和有效性的讨论中提出的不同观点和常见批评。

6.1. 经典近似贝叶斯视角

不同观点:近似贝叶斯方法更接近深度学习中的标准工作流程,因此比SAI更实用。

我们的回应:我们同意这一观点。这正是我们所倡导的。之所以存在这种感知上的差距,是因为目前缺乏SAI的鲁棒端到端软件(第5.4节),且在推断管理方式上存在显著差异(第5.2节)。我们认为,通过建立和共享经验知识,类似于经典深度学习成熟的路径,我们可以使SAI工作流程同样易于使用和直观(第4.3节)。

常见批评:从业者永远无法确定采样是否达到了平稳分布。我们的回应:在高维BNN中,现实计算预算约束下,没有人能保证收敛。因此,SAI显然仍然是一种近似方法。然而,基于采样的近似的灵活性已被证明优于其他近似贝叶斯方法中更刚性的结构假设,在许多情况下带来了更优越的预测性能和不确定性量化(第4.1节)。我们的目标不是渐近完美,而是大幅更好且更可信的近似。

不同观点:近似贝叶斯方法在可扩展性上至少始终与SAI相当。
我们的回应:虽然近似贝叶斯方法在某些方面可能具有固有的可扩展性优势,但如果SAI的计算成本与之相当,那么其显著提升的预测性能和不确定性量化将构成一个有说服力的权衡。我们认为未来在于利用优化和近似贝叶斯工具来提升SAI的可扩展性,特别是通过并行化探索策略(第4.2节),而非将它们视为根本分离或相互竞争的范式。

不同观点:某些近似贝叶斯方法可以被证明能够恢复重要特征。
我们的回应:此类理论保证(参见,例如,Margossian & Saul,2025)往往依赖于强假设,有时甚至不切实际,在BNN典型的复杂多模态后验景观中经常失效。我们对灵活采样方法的聚焦旨在捕获完整的后验结构,这往往是那些有“保证”但过度限制的近似所无法企及的。

6.2. 基础模型

常见批评:没有人能够存储GPT-5模型的多个权重副本。
我们的回应:对于GPT-5规模的模型,有能力训练此类模型的组织也拥有存储多个权重副本或后验样本的资源。对于更广泛的社区而言,即使是在非贝叶斯背景下,训练和存储这种规模的模型已经是不可行的。我们的立场主要针对广泛的现代中大型BNN(例如,如表1所示),在这些模型中存储样本是可行且有益的,如第5节所述。

质疑性问题:贝叶斯深度学习的计算开销对于LLM而言是否合理?
我们的回应:随着LLM巩固其作为许多现代AI系统支柱的角色,很自然地会质疑通过BDL量化认知不确定性在该场景中的相关性。要回答贝叶斯处理的计算开销对于基础模型是否合理,我们必须区分语义不确定性和认知不确定性。在开放式生成中,歧义性是数据固有的;模型可能对合理下一个词元的分布是确定的,但语义结果自然变化(Kuhn等,2023)。虽然实验表明贝叶斯边缘化可以改善困惑度等似然指标(Sommer等,2026a),但在高度随机的开放式生成任务中量化和整合认知不确定性的实际效用仍是一个活跃的研究领域,其确切收益尚不明确。

然而,工业LLM部署的相当大一部分——从自动分诊和医疗诊断支持到RAG上下文优化——依赖于LLM作为判别式分类器(Brown等,2020)。在这些监督式场景中,模型充当决策者而非创造性写作者。在这种情况下,通过后验预测密度量化认知不确定性的能力是有明确意义的。我们设想在结构化生成(Willard & Louf,2023)的背景下,词元级不确定性尤其具有影响力——这是智能体工作流中必不可少的范式,其中可靠且语法正确的输出是有效自主行动的先决条件。

虽然对大多数从业者来说,采样数十亿参数目前是不可行的,但这一限制同样适用于标准优化;在此规模上进行完整的预训练或微调很少进行。我们认为SAI不必意味着全模型采样。近期在采样低秩适配器(Duffield等,2025;Yang等,2024)或将经典BDL中的推断限制在特定子网络(Daxberger等,2021b)方面的成功表明,我们可以将预训练权重视为固定的特征提取器,并在特定子集上执行高效采样。这种混合方法为在基础模型中实现鲁棒的不确定性量化提供了一条务实路径,而无需承担全规模MCMC可能带来的过高成本。

7. 结论

贝叶斯神经网络的基于采样的推断已到达一个关键转折点。虽然算法的进步证明了其效率和竞争力,该领域现在必须将关注点转向部署的实际问题。我们的核心立场是,广泛采用的关键不仅在于算法改进,更在于解决端到端采样流程中那些尚未得到充分重视的挑战,同时消除一些关于初始采样成本的持续误解。这包括采纳高效生成和管理后验样本的方法(反驳该阶段本质上成本过高的观念),以及开发有效的后验样本蒸馏策略以实现快速推断。通过摒弃植根于经典贝叶斯设定中的过时假设,并协同投入于厘清样本生成的可行性以及下游样本利用这一尚未充分探索的领域,BNN学术界可以将采样从理论理想转变为贝叶斯深度学习中实际且有影响力的现实。

原文链接:https://arxiv.org/pdf/2605.21765