基于成分数据分析的几何感知贝叶斯量化

GEOMETRY-AWARE BAYESIAN QUANTIFICATION VIACOMPOSITIONAL DATA ANALYSIS

https://arxiv.org/pdf/2607.04977

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

摘要

准确估计未知的目标标签分布是适应标签偏移的关键第一步。这项被广泛称为量化或类别流行度估计的任务,最近通过基于连续KDE的方法取得了显著进展,这些方法对多分类分类器后验的密度进行建模。后验向量可以被视为成分数据,因为它们位于概率单纯形上。然而,现有的基于KDE的量化器通常依赖于欧几里得高斯核,这忽略了单纯形几何,并在其边界外错误地分配概率质量。我们引入了一种基于对数比表示和Aitchison几何的多分类量化几何感知KDE模型,并结合了一种收缩正则化以提高单纯形边界附近的鲁棒性。结合基于KDE的量化的最大似然解释,我们推导了类别流行度的点估计和贝叶斯推断程序。在跨越表格、文本和图像领域的42个数据集上的实验表明,所提出的方法与最先进的量化器具有竞争力,通常优于标准的基于KDE的基线,同时在贝叶斯量化方法中也产生了强劲的结果。

1 引言

部署在实际场景中的机器学习模型经常遇到标签偏移[41]。适应这种偏移需要准确估计未知的目标标签分布。这个问题被称为量化[16]或类别流行度估计[31],在总体趋势比个体预测更重要的领域中,是一项关键的独立任务。此外,它作为标签偏移适应的基本基础,因为严格需要准确的流行度估计来计算用于分类器重训练的重要性权重[3]。

许多突出的方法,如标签偏移最大似然(MLLS)[38]和黑盒偏移估计(BBSE)[31],直接对基础分类器产生的后验概率进行操作。在多分类量化中,使用像KDEy [35]这样基于密度的方法对这些后验的连续分布进行建模,已成为一种自然保留跨类别依赖结构的强大替代方案。因此,KDEy越来越多地被用作各种应用领域的稳健解决方案,如信息检索中的公平性监控[27]、图相关应用[8, 33]、分类器准确率预测[44]和医疗保健中的医学成像[20]。

然而,通过连续密度估计对分类器后验进行建模引入了一个根本的几何不匹配。后验概率向量位于概率单纯形上,因此构成成分数据。现有的基于KDE的量化器依赖于欧几里得空间中的高斯核,这忽略了这种相对结构,并不可避免地在单纯形边界外分配概率质量。这种不匹配在单纯形边界附近变得特别成问题,在许多实际场景中后验概率在那里高度集中。

在这项工作中,我们从成分数据分析(CoDA)[1]的角度重新审视多分类量化,以解决这一瓶颈。我们引入了一种基于对数比变换的几何感知核,能够在Aitchison几何中进行连续密度估计。虽然这种表示与底层的单纯形结构更一致,但朴素的对数比建模在边界附近可能不稳定。为了解决这个问题,我们提出了一种提高鲁棒性的基于收缩的正则化。基于这种表示,我们将量化公式化为一个混合密度估计问题,该问题自然地允许对类别流行度进行点估计和贝叶斯推断。在跨越表格、文本和图像领域的42个数据集上,所提出的方法实现了与最先进方法具有竞争力的性能。它经常改进标准的基于KDE的量化器,同时提供了单纯形上连续密度估计的原则性几何公式。

2 相关工作

关于标签偏移适应和量化的文献主要集中在标签偏移(又称先验概率偏移)的设置上[41]。现有方法包括分类计数变体(例如,BBSE [31],在量化文献中也称为调整分类计数(ACC)[16]或[38]中的混淆矩阵方法)、分布匹配方法[21, 5, 11],以及通过期望最大化的最大似然方法(例如,MLLS,在量化文献中通常称为EMQ)[38, 4, 3]。其中,像KDEy这样基于KDE的方法最近已成为多分类设置中的强劲方法[35]。

基于自举的方法已被探索用于推导量化中的不确定性估计[24, 9, 42]。针对特定估计器,也开发了置信区间估计的分析方法[14, 10]。最近,已为标准量化器提出了贝叶斯量化方法[15];示例包括用于BBSE/ACC的BayesianACC1、用于MLLS/EMQ的MAPLS [46, 25],以及用于HDy [21]的精确量化器(PQ)[26]。然而,PQ使用的分箱概率上的多项式模型(HDy直方图表示的类似物)继承了单变量离散化密度模型的局限性,因此仅限于二分类问题。这些局限性被基于KDE的连续多变量密度模型所克服[35]。

尽管如此,先前没有工作为基于KDE的量化器开发贝叶斯公式;我们填补了这一空白。我们还注意到,基于高斯核的KDE模型可能不适合成分数据。在成分数据文献中确实存在欧几里得KDE的单纯形支持替代方案,最著名的是Dirichlet核和逻辑正态核估计器[2]。后续工作进一步发展了对数比路线,特别是通过在等距对数比(ILR)坐标中定义的高斯核以及现代带宽选择方法,表明当目标是尊重成分数据的几何时,这条路线特别自然[6, 32]。同时,Dirichlet核在理论上仍然具有吸引力,因为它们原生支持在单纯形上并表现出有利的边界行为[37]。在实践中,直接将标准成分核应用于分类器输出是困难的,因为自信的预测导致(大概校准良好的)后验在单纯形边界处高度集中。此外,与标准欧几里得KDE不同,这些单纯形感知估计器缺乏用于机器学习流水线的直接插入实现。通过引入收缩正则化对数比表示,我们弥合了这些差距,提供了一种数学上有原则但在计算上实用的解决方案。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

4 基于KDE的量化中的几何不匹配

打开网易新闻 查看精彩图片

几何不匹配在单纯形边界附近尤为严重。在许多实际的分类问题中,后验向量倾向于集中在顶点或边附近,这对应于高置信度的预测或各类别间高度不平衡的不确定性。对于已知存在过度自信问题的神经分类器来说,情况尤其如此,在这种情况下需要进行后验校准[22]。在这些区域,欧几里得高斯核将其概率质量中不可忽略的一部分分配到了单纯形之外,而这正是支撑约束最严格的区域。与此同时,来自成分数据分析(CoDA)的天然工具(即对数比变换,如中心对数比(CLR)和等距对数比(ILR)映射)在边界附近变得越来越敏感,因为在那里一些坐标趋近于零。这产生了一种矛盾:虽然对数比几何对于取值于单纯形的数据更为合适,但在几何不匹配影响最大的情形下,对CLR/ILR的朴素应用本身可能会变得不稳定。图1说明了这种效应。

打开网易新闻 查看精彩图片

这些观察结果表明,基于密度的量化应该在单纯形的几何感知表示中进行,而不是在环境欧几里得空间中进行。在下一节中,我们使用对数比坐标来构建这种表示。我们进一步表明,尽管CLR/ILR提供了正确的几何框架,但仍需要额外的正则化才能在单纯形边界附近获得稳定的密度估计。

5 收缩正则化的几何感知 KDE

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

尽管对数比坐标具有几何吸引力,但它们在单纯形边界附近是微妙的。每当 p p 的一个或多个分量趋近于零时,相应的对数比在量级上会变得很大,这可能导致不稳定的密度估计和高度扭曲的局部几何。这在量化中尤为成问题,因为后验概率可能会合理地达到零或接近零的值。为了缓解这个问题,我们引入了一种收缩变换,它将每个成分从边界移开并朝向单纯形的重心

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

5.2 贝叶斯后验推断

前述结果直接导出了几何感知 KDE 量化的贝叶斯表述。给定流行度向量上的先验,后验分布为

打开网易新闻 查看精彩图片

因此,尽管精确的单纯形密度在形式上包含一个雅可比项,但后验推断可以直接使用上述未归一化的后验在变换坐标中进行。这是使贝叶斯推断在基于KDE的量化中变得实用的关键观察。请注意,相同的抵消论证也适用于点估计,因为在变量变换下,独立于 π π 的乘法常数不会影响公式1中的 argmax。

打开网易新闻 查看精彩图片

6 实验

数据集。 我们在 42 个跨越文本、表格和图像领域的数据集上进行评估,类别数量范围从 2 到 100,这些数据集曾在先前的相关研究中使用。文本套件包括标准的 LeQua 基准 [12, 13] 和 11 个 Twitter 情感数据集 [17];表格套件包含 22 个 UCI ML 数据集 [28];图像套件包括 CIFAR10/CIFAR100 [29]、MNIST [30]、FashionMNIST [45] 和 SVHN [36]。完整的数据集统计信息见附录 D.1。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

6.1 结果

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

计算成本。 所提出的方法需要优化带宽和收缩,这增加了计算成本。然而,一旦设定,推理时的成本与竞争对手没有显著差异。所有实验都在标准台式工作站上运行,无需专用的高性能计算基础设施。

打开网易新闻 查看精彩图片

7 结论

我们提出了一种在标签偏移下进行多类量化的几何感知、不确定性感知方法。该方法基于两个想法。首先,我们通过成分数据分析重新审视了基于KDE的量化,用与单纯形几何更好对齐的收缩正则化对数比表示,替代了后验概率上的欧几里得密度估计。其次,我们证明了该密度模型允许贝叶斯公式化,从而能够对类别流行度进行后验推断并进行原则性的不确定性量化。在经验上,所提出的几何感知KDE在点估计和不确定性量化方面通常优于标准高斯KDE和其他基线。这些结果表明,尊重单纯形几何不仅有充分的动机,而且在实际中对多类量化也是有益的。我们的实验还表明,仅靠几何感知是不够的:收缩对于稳定单纯形边界附近的对数比建模至关重要。

局限性和开放方向: 我们的研究仅限于通过验证选择收缩和带宽值的情况,而对这些参数进行更完整的贝叶斯处理可能值得研究。我们的方法强烈依赖于标签偏移所特有的分布假设。研究针对不同类型偏移(如协变量偏移 [43] 或稀疏联合偏移 [7])的变体,似乎是量化领域未来工作的一个有前景的方向。

原文链接:https://arxiv.org/pdf/2607.04977