多维分类分布的树嵌入贝叶斯因子模型

Tree-Embedded Bayesian Factor Models for MultidimensionalCategorical Distributions

https://arxiv.org/pdf/2603.02502

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

摘要

通过分层模型分析从多个观测单位收集的数据,以估计共同结构和异质结构,是贝叶斯推断中的一项核心任务,为此,贝叶斯因子模型是用于此目的最广泛使用的工具之一。在本文中,我们提出了一种新颖的贝叶斯潜在因子模型,用于分组数据中的分类分布,提供了一种简约模型,通过低维结构来描述许多观测到的分布。分组数据在社会科学中广泛出现,例如,在不同地点观测到的年龄构成分布和收入分布。在这些情境中,标准混合模型可能效率低下,因为这些分布不一定表现出清晰的聚类结构,而且这些分布可以更准确地近似为低维特征的组合。为了用贝叶斯因子分析来分析分布值数据,我们采用一种基于树的变换,将分布嵌入欧几里得空间,并在变换后的空间中构建贝叶斯潜在因子模型。我们通过引入无限因子模型来开发该分层模型,该模型可以自适应地估计有效因子的数量。此外,我们通过引入基于同时自回归(SAR)模型的先验来纳入空间依赖,从而提出其推广形式。所提出的模型能够提供多变量分布结构的平滑估计,因为一旦应用了基于树的变换,单变量分布和多变量分布本质上都被视为相同的欧几里得向量。通过使用真实人口数据的数值实验,我们证明,在涉及平滑空间变化的各种场景中,尤其是在小样本量下,所提出的模型优于现有的参数模型和贝叶斯非参数模型。

1 引言

在广泛的应用中,数据分析会遇到这样一类数据集,其中每个观测值本身就是一个概率分布,而不是单个标量或向量。我们研究的一个动机示例出现在社会科学背景下收集的人口研究中,其中每个地点都由一个经验分布来刻画,该分布描述了常住人口在年龄和性别类别上的人口构成。类似的分布值观测也出现在社会科学的其他应用中,例如跨地区预定义收入类别上的收入分布,或大规模调查中的分组响应。在这些情境中,主要的研究兴趣不在于分别估计每个分布,而在于理解分布如何在不同单位之间变化,以及这种变化是否可以概括为低维结构。在人口数据示例中,自然可以认为不同地点的分布并非独立,并假设分布的变异性可以由(可能少量的)特征来解释,例如年轻、劳动年龄和老年类别的人口比例。因此,开发一种能够在概率分布的内在约束下提取此类低维结构的统计工具,具有核心重要性。

为了在保持可解释性的同时综合多个观测单位的信息,一种自然的方法是采用贝叶斯因子模型(Lopes and West, 2004; Prado and West, 2010)。在此框架下,大量观测到的分布可以通过数量少得多的潜在因子来解释,前提是能够为分布引入一个适当的贝叶斯因子模型。这样的模型将非常适合许多情形,包括人口数据分析,因为它会自动识别出解释观测之间主要差异的因子。然而,将因子模型直接应用于分布数据并不简单,因为因子模型的标准表述假设观测值位于欧几里得空间中,而不是位于概率单纯形上。

我们通过使用 Wang 等人(2026)引入的二叉树划分结构对分布进行变换,来弥合分布数据与标准贝叶斯因子模型之间的差距。正如 Wang 等人(2026)通过“逻辑树”构造所表述的那样,我们可以在一个分布与定义在树的内部节点上的一组条件概率之间建立双射。因此,通过对节点概率进行逻辑变换(Jara and Hanson, 2011),我们可以获得分布的欧几里得向量表示,同时保持与原始分布的一一对应关系。我们注意到,Wang 等人(2026)的模型旨在估计成分数据分析中的混合效应,以检测对比环境中的差异。在本研究中,我们通过建立一个新的方向来推广逻辑树变换的思想,即提出一个新颖的分布因子模型的一般框架。此外,正如我们将详细说明的那样,我们通过纳入空间信息来展示所提出模型的灵活性。

采用基于树的表示的一个重要优势是,它自然地保留了类别的顺序,允许相邻值属于同一节点或在树中共享共同祖先。这一性质对于分组数据或连续数据特别有用,因为相邻类别预期会共享相似的分布结构。此外,所提出的框架避免了对潜在分布过程的参数假设。引入参数假设对于在特定推断任务中估计分布结构是有效的,例如使用单峰参数分布估计收入分布(Kobayashi et al., 2022; Sugasawa et al., 2020),但这样的参数方法在未知分布的多峰性或间断性下并不奏效。相比之下,基于树的方法允许更加灵活的估计,正如关于 Pólya 树过程模型的研究所表明的那样(Lavine, 1992; Hanson, 2006; Wong and Ma, 2010)。在所提出的框架中,与 Pólya 树一样,我们通过类似的基于树的构造来指定灵活的生成模型,以捕捉观测分布的特征,而无需参数假设。

采用基于树的分解的另一个优势是,该框架自然地扩展到多维情形,正如基于 Pólya 树过程的分析所展示的那样(Wong and Ma, 2010; Awaya and Ma, 2024)。给定树划分结构,多维分布可以通过与单变量分布本质上相同的递归构造来表示(此类树的一个示例见图3)。这一性质使我们能够在统一的框架中描述单变量和多变量模型。最重要的是,这些模型可以用相同的 MCMC 算法进行估计。由于我们提出的模型由条件独立的节点参数组成,且似然以逻辑形式描述,所得后验允许使用 Pólya Gamma 增广(Polson et al., 2013)得到高效的 Gibbs 采样器。这一优势使该模型适用于各种推断任务,包括社会科学应用,其中数据集通常涉及多个变量,例如具有年龄-性别联合构成的人口数据,或由多个问卷项目组成的调查数据。

我们注意到,逻辑树变换的一个主要优势是存在高效的 Gibbs 采样器,这一点与其他将分布映射到欧几里得空间的变换类型不同。例如,在成分数据分析的背景下已经提出了几种类型的变换(参见,例如,Aitchison, 1982; Egozcue et al., 2003; Silverman et al., 2017)。然而,正如 Wang 等人(2026)所讨论的,在此类变换下构建简单高效的 MCMC 采样器并不那么直接。

有人可能会认为,基于混合的方法,如 Dirichlet 混合模型和 Dirichlet 过程混合模型(Müller et al., 2015; Ghosal and van der Vaart, 2017),可能比因子模型更有优势。然而,在许多社会科学应用中,分布数据并不表现出清晰的聚类结构;相反,如第5节中的真实数据分析所示,分布通常随着地点或其他特征而逐渐变化。在这种情况下,混合模型往往会产生过多的聚类数量,并且不可能获得数据的低维概括。相比之下,即使聚类结构较弱或不存在,因子模型也能提供更简约的表示,用少量潜在因子的组合来描述多样的分布。作为说明,图2可视化了从所提出的因子模型生成的具有四个类别的模拟分布(细节见第2节)。在该图中,我们仅组合了第一列中显示的三个分布,我们称之为“因子分布”,而所提出的模型可以表达多种分布结构。

一旦每个分布通过逻辑变换被表示为欧几里得向量,就可以在 Pólya-Gamma 混合下获得线性高斯似然,因此扩展贝叶斯分层模型变得直接明了。所提出的框架展示其灵活性的显著特征如下。首先,我们将无限因子模型(Bhattacharya and Dunson, 2011; Durante, 2017)的乘法 Gamma 过程纳入模型中,以便我们能够在不确定因子数量的情况下,自适应地估计观测分布的相关性和变异性中的低维特征。其次,为了有效地利用位置信息来估计人口数据,我们在因子载荷上纳入同时自回归(SAR)先验,以捕捉跨位置的空间依赖。我们注意到,这些组成部分仅代表所提出框架内的一种可能实现;替代的贝叶斯因子模型或额外的协变量结构可以以类似方式纳入。

除了建模方面的发展外,我们还提供了所提出因子模型的理论保证,重点关注后验一致性。我们理论研究中一个值得注意的发现是,即使真实分布结构中有某些单元被分配了恰好为零的概率,后验一致性仍然成立。逻辑树模型对此类零概率或零计数的稳健性已在 Wang 等人(2026)中讨论过,但我们首次提供了理论结果来证明这种稳健性。我们还注意到,即使模型纳入了空间相关性,即以 SAR 模型作为分层模型中的一个组成部分,我们也能建立后验一致性。

在本研究中,我们侧重于分组数据的估计,即具有离散且有序类别的分布结构,因为这一新颖因子模型的提出主要受到具有离散年龄和性别类别的人口数据的启发。然而,我们要强调,连续分布也有望用我们提出的模型进行分析。例如,在使用 Pólya 树过程进行密度估计时,通常拟合具有有限深度的树划分来捕捉基本的分布结构(参见,例如,Hanson, 2006; Soriano and Ma, 2017)。一旦固定了有限树,离散分布和连续分布都可以用相同的模型进行分析,因为在两种情况下,估计都归结为对树上节点参数的后验推断。

本文的其余部分组织如下。第2节介绍了基于一种新颖的分布树分解所提出的分类数据因子建模框架。我们还纳入了空间相关性,以说明该框架的灵活性。第5.2节展示了对日本城市地区收集的常住人口数据的应用,以及对分类数据替代模型的经验比较。第6节总结全文。

2 面向分类分布的树嵌入因子模型

在本节中,我们描述所提出的因子模型,首先讨论分组数据的基于树的分解,因为它构成了所提出因子模型及其空间扩展的基础。然后我们解释如何在树分解上构建因子模型,以及如何通过 SAR 模型纳入空间相关性信息。

2.1 分组数据的逻辑树分解

令 Ω 表示所考虑的所有有限类别的集合。 Ω Ω的元素可以由多个特征来索引。例如,在人口数据中, Ω 是多维的,并由离散特征(如性别和年龄)来索引。我们假设有一个在 Ω Ω中的类别上构建的递归树划分结构 T T。在我们的分析中,我们特别关注二叉树,即每个节点被分裂为两个子节点的递归划分,遵循贝叶斯树模型中的常见设定(Chipman et al., 1998, 2010)。图3提供了一个说明性示例,其中树是为二维类别定义的。在某些情况下,存在树结构的自然候选(例如,微生物组数据的系统发育树(Wang et al., 2026)),而在许多应用中,需要一种适当的算法来构建树以进行分析。我们将树构建细节的讨论推迟到第2.6节,在接下来的讨论中假设树 T 是可用且固定的。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

沿树划分定义的分布的一个关键性质是,该分布由定义在内部节点上的条件概率唯一刻画:

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

每个节点参数 θ ( A ) 的支撑集被限制在有限区间 ( 0 , 1 ) 内,因此,例如,许多 Pólya 树模型采用 Beta 先验以利用共轭性(Ma and Wong, 2011; Soriano and Ma, 2017; Awaya and Ma, 2024)。然而,在本工作中,为了便于引入因子模型,我们遵循逻辑树正态表述(Jara and Hanson, 2011; Wang et al., 2026),该表述常用于实值向量,并引入逻辑变换后的参数

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

在这种嵌入下,Jara and Hanson (2011) 构建了一个带有高斯过程先验的分层模型,而 Wang et al. (2026) 通过图形套索型先验和混合模型展示了更丰富的潜在结构。由于我们的目标是在人口数据分析中概括许多观测分布的信息,我们通过为分布观测引入一种新颖的因子模型,建立了一种利用树嵌入的新方法。

注:基于树的变换应与将观测比例直接变换为欧几里得向量的方法区分开来,后者在成分数据分析中很常见(Aitchison, 1982; Egozcue et al., 2003)。在所提出的模型中,我们将变换应用于未知的多项分布 P i ,可观测比例是从该分布生成的,因此生成模型被估计。这种建模方法在贝叶斯估计中特别有益,因为我们可以成功地量化估计中的不确定性,这种不确定性是由总计数差异引起的。例如,我们可以考虑两种情况,其中我们观察到完全相同的比例但总计数不同。我们可以通过指定生成模型来区分这两种情况,因为总计数的差异会导致若干方面的差异,例如后验方差和可信区间。

2.2 离散分布的因子模型

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

2.4 后验采样

推导后验采样算法是直接的,因为正如 Wang et al. (2026) 所讨论的,逻辑树表述允许引入 Pólya-Gamma (PG) 增广 (Polson et al., 2013)。我们在此简要概述所提出模型的 PG 增广,而详细的采样步骤在附录 A 中提供。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

2.5 因子载荷的后处理

本工作中采用的无限因子模型在捕捉 M M个观测分布之间的相关性结构方面具有很强的表达能力。我们可以证明该模型下的后验一致性,这将在第 3 节中讨论。然而,为了可解释性,确定能够充分解释依赖结构的因子数量是有效的,以便更好地解释估计结果。此外,载荷矩阵上的先验没有施加任何约束来解决由符号切换和旋转不变性引起的不可识别性问题(参见,例如,Papastamoulis and Ntzoufras, 2022),因此在不加修改的情况下概括 MCMC 样本会产生误导。为了解决这些问题,我们遵循 De Vito et al. (2021) 的后处理策略。

2.5.1 选择最优因子数量

打开网易新闻 查看精彩图片

2.5.2 解决可识别性问题

打开网易新闻 查看精彩图片

2.6 关于树构建算法

在本节中,我们讨论树构建算法,这对于使所提出的逻辑树方法成为可能至关重要。在用于估计分布的基于树的模型文献中,例如从树的后验中采样的贝叶斯算法(例如,Wong and Ma, 2010; Awaya and Ma, 2024),会为树结构引入先验分布,并且计算方法会探索所得的后验。当我们可以评估树的边际似然、并对定义在树上的变量进行积分消除时,此类计算算法是可行的。然而,这样的框架对于所提出的模型是不可行的,因为该模型配备了无限因子模型,其在潜在变量中具有复杂的依赖结构。因此,我们采用一种替代策略,在实施因子分析之前采用并固定树结构。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

我们采用 Glahn et al. (2011) 的最大解释方差分层平衡(MV)算法,该算法遵循从粗到细的贪婪策略。当分裂节点 A A时,通过计算所得平衡的方差来评估候选划分,并选择使该方差最大化的分裂。虽然原始 MV 算法仅评估候选分裂的一个子集,但在我们的应用中,类别数量相对较少,这使我们能够穷举评估所有可能的划分。

作为说明,图 3 展示了根据 2019 年 12 月 24 日 19:00 观测到的人口数据构建的树。二维类别首先被划分为两个年龄组,这表明地点之间的变异主要由老年人口比例驱动。在随后的分裂中也观察到相同的趋势。根据计算出的平衡,较大的变异往往由年龄构成的差异来解释。

打开网易新闻 查看精彩图片

应当指出,MV 算法仅作为默认选择来讨论,其他类型的数据驱动树算法,例如基于中位数的 kd 树(Walther and Zhao, 2023),也可以是适用的。我们也可以不参照数据来构建树,例如,构建一棵对称树,将相同数量的类别分配到每对子节点中,因此人们可能会担心对树选择的潜在敏感性。为了解决这一潜在担忧,我们在附录 D 中进行了敏感性分析,评估了五种树构建算法,包括上述讨论的那些。分析表明,所考虑的所有树算法都表现出相似的性能,这意味着对树的选择几乎没有敏感性,这一发现与 Wang et al. (2026) 中进行的敏感性分析一致。

3 所提出因子模型的理论性质

在本节中,我们建立所提出方法的渐近性质,特别关注其一致性。具体而言,我们将欧几里得向量观测的无限因子模型的后验一致性结果(Bhattacharya and Dunson, 2011)推广到我们所提出的、用于高维分类分布的、具有空间相关潜在因子的分层模型。尽管结果将在后续章节中正式呈现,但值得总结主要发现。首先,虽然 Bhattacharya and Dunson (2011) 在条件独立因子载荷下建立了无限因子模型的后验一致性,但我们将其结果扩展到由 SAR 型先验诱导的具有空间相关载荷的设定。其次,一致性结果是为分类分布建立的。特别地,我们的理论涵盖了某些真实类别概率恰好为零的边界情况,从而为逻辑树模型能够在没有显式零膨胀成分的情况下解决 Wang et al. (2026) 所讨论的零单元问题提供了正式支持。

3.1 对真实数据生成过程的假设

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

应当指出的是,该单纯形空间的元素允许具有恰好为零概率的单元。此外,为了简化讨论,我们假设有 n 个独立同分布(i.i.d.)观测,它们是从乘积测度中生成的

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

3.2 分布因子模型的性质与后验一致性

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

因此,根据 Schwartz 定理,后验分布是弱一致的。

尽管定理 3.1 是在 SAR 先验下陈述的,但同样的后验一致性结论预计可以推广到其他空间依赖结构,例如 CAR 先验或高斯过程先验,只要诱导出的载荷过程先验足够良好,以控制无限因子表示,并且足够灵活,以近似真实分布。在这种情况下,先验继续为真值的 Kullback-Leibler 邻域分配正质量,一致性论证也以相同方式成立。具体的充分条件和相应的证明策略在附录 B.2 中讨论。

4 数值实验

在本节中,我们通过模拟实验和对人口数据的实证分析来评估所提出的分布因子模型。模拟实验旨在检验所提出的模型在各类分布结构(例如平滑异质性和多维分类结构)下的表现。

我们使用第 2.6 节中描述的 MV 树构建器和一种简单的分裂算法(“中点法”)来评估所提出的因子模型,后者总是从中间点分裂节点,并在分裂后生成具有相同类别数量的子节点。(树构建算法的细节,包括敏感性分析中使用的那些,在附录 D.2 中描述。)我们展示了与两种基准方法的比较:Dirichlet 过程混合模型(DPM)和独立 Dirichlet 模型(ID)。ID 基准在每个位置拟合一个单独的 Dirichlet-多项模型,因此不跨位置借用信息。本节提供了所提出的具有 SAR 型相关性的因子模型与基准模型之间的比较。人们可能会担心实验的公平性,因为基准模型(尤其是 DPM)没有纳入空间信息。因此,我们进行了另一种比较,使用所提出的 即无空间相关性的模型。附录 D 提供了结果,其本质上与空间情形相同。

对于 MCMC 采样,我们使用在大小为 1000 的预热期之后模拟的 5000 个抽样。最大因子数量 K K设为 10。固定空间相关性和替代树构建器的额外结果报告在附录 D.2 中。

在两个实验中,为了评估竞争方法的性能,我们为每个场景模拟 50 个不同的数据集,并计算 Kullback-Leibler(KL)散度和 Hellinger 距离。

打开网易新闻 查看精彩图片

  1. “双参数” 该场景受 Sugasawa et al. (2020) 启发,第 i i个位置的潜在分布由对数正态分布指定

打开网易新闻 查看精彩图片

2:“混合” 第 i 个位置的潜在连续分布是三个对数正态分布的混合

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

我们在两种样本量设定( n = 200 和 n = 1000 )下进行了实验,结果总结在表 1 中。结果表明,在两种一维场景和两种样本量设定下,所提出的因子模型均优于两个基准模型 DPM 和 ID。MV 和 Midpoint 树构建给出了几乎相同的性能,这表明在这些一维设定中,估计精度对树构建的这一特定选择并不高度敏感。

打开网易新闻 查看精彩图片

与 DPM 的比较阐明了基于混合的表示与基于因子的表示之间的差异。在这些一维场景中,真实分布随位置空间平滑变化,而不是形成清晰分离的聚类。在此类设定中,用少量潜在因子来表示变异比将每个分布分配给一个潜在聚类更为自然。这解释了为什么所提出的因子模型能比 DPM 更准确地估计平滑变化的分布。

此外,与 ID 的比较凸显了跨位置借用信息的重要性。尽管 ID 作为每个分类分布的模型是灵活的,但它独立地估计每个位置特定的分布。因此,它无法利用跨位置共享的共同低维结构或空间平滑性。ID 在样本量减少时的性能恶化表明,当局部计数有限时,这种信息共享尤为重要。

4.2 三维场景

三维场景定义在乘积样本空间 X = A × B × C 上,其中每个集合由有序类别组成,如下

打开网易新闻 查看精彩图片

第一维 A A被解释为与一维场景中使用的相同的有序八类别划分,而另外两维被视为额外的分类坐标。我们考虑以下三种场景。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

这些结果表明,因子表示的优势并不限于一维有序类别。即使在多维分类空间中,一旦通过树变换将分布嵌入,所提出的模型也能够利用跨位置的共同低维变异。

“3D 聚类”场景的结果应单独解读。在此场景中,数据生成过程明确基于聚类,因此 DPM 预期具有优势。事实上,DPM 在此场景中给出了最佳性能。这一结果并不与所提出因子模型的有用性相矛盾;相反,它阐明了每种模型更适合的结构类型。当真实分布形成清晰聚类时,混合模型自然是合适的。当分布随位置连续变化而没有清晰聚类边界时,因子模型提供了更合适的表示。

此外,所提出的因子模型优于混合模型这一事实并不是最重要的结果。如上所述,使用因子模型的一个主要优势是我们可以用低维特征来概括数据的信息,从而使结果变得可解释。我们在第 5.2 节中使用真实人口数据展示了这种可解释性。

5 在空间人口数据上的应用

在本节中,我们首先使用真实空间人口数据对所提出的因子模型和基准模型进行定量评估,以检验模型在现实情境中的有效性。之后,我们讨论从所提出模型获得的启示,以阐明使用因子模型,我们可以用较低维的结构来刻画观测到的 400 多个分布,因此结果具有高度可解释性。

5.1 模型评估

在这项实证研究中,我们分析了由 NTT Docomo(日本最大的移动运营商之一,拥有超过 9000 万账户)提供的常住人口数据。基于其运营数据,统计每个基站区域内的移动终端数量。然后,利用 NTT Docomo 的渗透率(参见 Terada et al. (2013); Oyabu et al. (2013))高精度地外推每个区域的人口。我们考虑东京五个特别区内的 500 米网格数据,包括 M = 452 个观测区域(网格)(图 5)。观测分布的一个样本也在图 5 中展示。同一数据集已在空间或时空分析的不同贝叶斯语境中使用过(参见,例如,Wakayama and Sugasawa, 2024; Wakayama et al., 2025)。

打开网易新闻 查看精彩图片

与上述仅考虑性别-年龄-总人口的研究不同,在本分析中,我们考虑按性别和年龄划分的人口分布。具体而言,该数据集提供两个性别类别(男性和女性)和八个年龄组:15–19、20–29、30–39、40–49、50–59、60–69、70–79 和 80 岁或以上。因此,对于每个区域和时间点,观测值表示为一个具有 N + 1 = 16 个类别的频率向量。在本分析中,我们从 2019 年 2 月、7 月和 12 月提取了九个具有不同时间特征(如早/晚和平时/假日)的特定时间点,详见表 3,并独立分析所选时间点的数据。每个区域都有相对较大的样本量;例如,对于第一个选定的时间(国定假日),平均总计数约为 6000。为了评估方法在不同信息量下的稳健性,我们使用原始数据集,以及将所有计数乘以 0.1 然后四舍五入为整数、从而减少到十分之一的修改数据。

由于真实数据生成过程的信息不可用,比较这三个模型的主要评估指标是 Gelfand and Ghosh (1998) 中定义的后验预测损失(PPL),其中较小的值表示模型拟合与模型复杂度之间更好的权衡。将他们的原始表述调整为人口数据的特定结构,我们将给定模型 M M的 PPL 定义为

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

与 DPM 的比较也支持与模拟实验中相同的解释。在两种数据设定下,DPM 给出的 PPL 值都大于最佳的 Factor PT 模型,并且在原始尺度上对于大多数目标也差于 ID。这些结果表明,所选东京区域的人口分布不能被少量离散聚类很好地概括。这一发现与我们观察到的事实一致,即对于原始数据,估计的聚类数量往往很大,并且在若干场景中可能大于 100,详见附录 D。因此,观测分布的变异最好被视为逐渐的空间异质性,对此因子表示更为合适。

空间成分的作用在减少数据中最为明显。对于原始数据,估计 ρ 的空间模型与 ρ = 0 的非空间模型之间的 PPL 差异相对较小,而非空间模型往往产生略小的 PPL。这意味着较大的局部计数已经包含足够的信息来准确估计每个分布。然而,在减少计数后,空间模型始终表现出相对于非空间模型的改进。因此,当局部样本量较小时,SAR 成分将通过空间借用信息在稳定估计方面最为有用。

5.2 分布因子分析提供的启示

接下来,我们描述对所提出因子模型所得结果的详细分析,选择 12 月 24 日 19:00 这一具体时间和日期,因为其启示清晰且高度可解释。图 3 可视化了基于 MV 算法构建的树的结果。在后处理中选择的因子数量在 90% 阈值下为 K ∗ = 4 。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

总之,结果具有高度可解释性;通过分布分析,我们可以以因子分布的形式,从数据中自适应地估计哪些人口特征解释了该区域人口分布的变异性。此外,通过映射估计的因子载荷,我们可以识别每个因子贡献强或弱的区域。这种可解释的结果很难通过独立估计分布或使用混合模型来获得。

6 讨论

在本文中,我们提出了一个贝叶斯分布因子建模框架,它将分组数据的基于树的表示与无限因子模型相结合,以通过低维潜在因子捕捉多个观测分布之间的复杂变异性。通过逻辑树变换将离散分布嵌入欧几里得空间,所提出的方法能够实现灵活的分层建模,正如通过纳入空间 SAR 先验所展示的那样。基于树的非参数表示允许捕捉多样的分布形状,同时通过 Pólya Gamma 增广使后验计算保持易处理。更广泛地说,所提出的框架为成分数据分析和现代贝叶斯因子建模之间提供了桥梁。

通过对东京时空人口数据的实证分析,我们证明了所提出的方法对异质人口模式产生了简约而富有表现力的刻画,在平滑空间变异下,其预测性能优于基于聚类的方法和参数替代方法。这些发现凸显了基于因子的表示对于表现出连续变异而非清晰分离聚类结构的分布数据的优势。

未来工作的一个重要方向是将所提出的框架扩展为显式构建时空动态模型。例如,在人口数据的背景下,这样的扩展可以捕捉一天内或跨季节的分布时间模式,并能够对每个位置特定性别-年龄类别的计数进行序贯预测。

原文链接:https://arxiv.org/pdf/2603.02502