Towards Learning Abductive Reasoning using VSA Distributed Representations利用VSA分布表征学习溯因推理 https://arxiv.org/abs/2406.19121
https://github.com/IBM/abductive-rule-learner-with-context-awareness
允许将谜题中的类比作为实数域中的简单代数运算来解决
前序论文:
2023
2022
2024
摘要
我们介绍了具有上下文感知能力的演绎规则学习器(Abductive Rule Learner with Context-awareness, ARLC),这是一个基于Learn-VRF解决抽象推理任务的模型。ARLC具有一个新颖且更广泛适用的演绎推理训练目标,从而在解决瑞文进阶矩阵(Raven’s progressive matrices, RPM)时提供了更好的可解释性和准确性。ARLC允许同时编程领域知识和学习数据分布背后的规则。我们在I-RAVEN数据集上评估了ARLC,展示了在分布内和分布外(未见过的属性-规则对)测试中的最先进准确性。
尽管参数数量比大型语言模型少几个数量级,ARLC还是超越了神经符号和连接主义基线。我们展示了ARLC在编程后训练的鲁棒性,通过在编程知识的基础上逐步从示例中学习,这只会提高其性能,而不会导致对编程解决方案的灾难性遗忘。我们验证了ARLC从2x2 RPM星座到未见星座的无缝迁移学习。我们的代码可在 https://github.com/IBM/abductive-rule-learner-with-context-awareness 上获取。
1 引言
抽象推理可以定义为从有限的经验来源中归纳规则或模式,并将其应用推广到类似但未见过的情况的能力。它被广泛认为是人类智能的标志,并且人们已经投入了巨大努力来赋予人工智能(AI)模型这样的能力。
因此,在过去十年中提出了广泛的基准测试,以评估AI模型中的类人流体智力和抽象推理能力[1,2,3,4]。在这项工作中,我们专注于瑞文进阶矩阵(RPM)测试[1,5,6]。RPM是一个视觉任务,涉及感知模式延续和元素抽象,以及基于一组受限的底层规则推断关系,这一过程反映了高级人类智能的属性[7,8]。最近,RPM已成为一个广泛使用的基准测试,有效地测试AI在抽象推理、类比制作和处理分布外(OOD)数据方面的能力[9,10,11,12,13]。
随着大型语言模型的出现,有人提出解决这类任务所需的抽象推理能力可能取决于模型的规模。为了支持这一主张,已经显示足够大的预训练语言模型可以表现出逻辑[14]和类比[15,16]推理的紧急能力。然而,这些能力出现的内部机制仍然不是很清楚。此外,最近的工作提供了这些能力的极度脆弱性的证据[17,18],而其他研究显示语言模型未能达到与人类相当的一般抽象推理水平[19,20,21,22]。
一个有前途的替代方向是神经符号人工智能。神经符号方法将亚符号感知与各种形式的符号推理相结合,从而在包括视觉[23,24,25,26]、自然语言[27]、因果关系[28]、数学[29]和类比[30,31,32,33,34]推理任务在内的一系列领域中取得了前沿性能。在RPM的背景下,最近的神经符号架构专注于演绎推理[33,34]。演绎推理允许根据先前以符号形式表示的知识选择性地推断命题,以尽可能好地解释感知观察结果[35]。演绎方法的吸引力在于它在符号推理中容纳了感知不确定性。演绎推理可以在利用分布式向量符号架构(VSAs)[36,37,38]表示和运算器的系统中实现,如神经向量符号架构(Neuro-Vector Symbolic Architecture, NVSA)[34]。然而,这些神经符号架构[33,34]需要对应用领域有完全的知识(可能不可用),以便将正确的归纳偏差编入模型中。
Learn-VRF [39] 通过引入一种从数据中学习 RPM 底层规则子集的概率性演绎推理方法,克服了这一局限性。Learn-VRF 在规则空间中透明地操作,通过将 VSA 属性表示软分配给固定规则模板来学习它们。在推理过程中,它通过执行所有学习到的规则并应用软选择机制来生成答案面板。然而,Learn-VRF 存在几个局限性,包括次优的选择机制、在涉及多个对象的 RPM 星座上表现不佳,以及对它能够学习的 RPM 规则的表达性有限制。
为了在推理学习方面取得进展,我们提出了具有上下文感知能力的演绎规则学习器(ARLC),以解决 Learn-VRF [39] 的主要局限性。我们提出了一种新颖的上下文增强优化问题公式和更具表现力的规则模板,这允许在执行和选择步骤中共享具有相同参数的规则,并提供更好的可解释性。图1展示了 ARLC 的概览。ARLC 具有可编程性,并且可以在编程知识的基础上进一步从数据中学习。
我们在 I-RAVEN 数据集的分布内(ID)和分布外(OOD)测试中评估了 ARLC,并展示了 ARLC 显著优于神经符号和连接主义基线,包括大型语言模型。
此外,与Learn-VRF相比,可训练参数的数量减少了两个数量级。我们通过编码领域知识来实验验证ARLC的可编程性,并发现编程后的训练与其他研究[40]相反,并不会损害解决方案的有效性,反而改进了它。最后,我们在单个星座上训练模型,并在I-RAVEN数据集的所有其他星座上评估它,我们展示了与以前的基线[39,34]不同,学到的规则可以无缝地跨星座转移。
2 背景
2.1 向量符号架构
向量符号架构(Vector-symbolic architectures, VSAs)[36,37,38] 是一类依赖于高维向量空间数学属性的计算模型。VSAs利用高维分布式表示来结构化(符号化)表示数据,同时保持连接主义分布式向量表示的优势(见[41]的综述)。以下是VSAs的正式定义:
定义 1 (VSA)。向量符号架构(VSA)由一个四元组 V = (C, ⊕, ⊗, ⊙) 组成,其中 C 是一组高维分布式向量,配备了两个主要操作 ⊕(捆绑)和 ⊗(绑定),并在此之上可以定义相似性度量 ⊙。
捆绑是一种保持相似性的运算,它创建了操作数的叠加,即,结果向量将与两个操作数具有高相似性。另一方面,绑定是一种将一个向量(值)绑定到另一个向量(键)的操作,它不保持相似性;它通常允许一个逆运算,称为解绑。捆绑、绑定的具体实现以及向量空间构成了VSA家族成员之间的主要差异。
2.2 瑞文进阶矩阵
在这项工作中,我们专注于 I-RAVEN 数据集[10],这是一个基准测试,它提供了从无偏见的候选集中抽取的 RPM 测试,以避免在原始 RAVEN 数据集[13]中可能的捷径解决方案。每个 RPM 测试是一个类比问题,以 3×3 的图形矩阵的形式呈现,每个矩阵单元格中都填充了几个基于某些规则的几何对象,除了底部右侧的单元格,它是空白的。图1包含了一个 I-RAVEN 示例测试。任务是通过从一组(八个)候选答案面板中选择正确的答案来完成缺失的面板,这个答案要匹配每个属性上的隐含生成规则。对象的属性(颜色、大小、形状、数量、位置)由各自的底层规则控制:
– 常数,属性值在每行中不改变;
– 算术,第三面板的属性值对应于行中前两个面板的和或差;
– 递进,属性值在一行中单调递增或递减1或2;
– 分配三个,三个不同的值的集合在行中保持不变,但个别属性值每行向左或向右移动一个位置;它也适用于列。
每个面板包含不同数量的对象(最少一个,最多九个),根据七种不同的星座排列(中心、四分、九分、左右、上下、内外中心和内外四分)。
2.3 使用分布式表示进行推理学习
在这一部分,我们讨论了如何使用向量符号架构来解决需要类比和关系推理的任务,例如RPM。特别是,我们关注Learn-VRF [39],这是一种简单但强大的方法,它通过学习VSA表示空间中视觉属性之间的底层关系来解决RPM测试。
这种方法背后的关键是,VSA代数中每条RPM规则的公式化是一个通用规则模板的特定实例,这个模板在所有规则之间共享,并且由一系列VSA向量之间的绑定和解绑操作组成。因此,学习RPM规则的问题可以被构建为视觉属性向量与这个通用规则模板中的项之间的分配问题。这种替代公式允许解决神经符号方法的一个主要限制,即可微性,因此使得它能够与基于梯度优化的数据驱动学习算法一起使用。
Learn-VRF包括几个顺序步骤,从将视觉属性转换为VSA高维空间到计算最终结果,这些步骤在以下段落中详细说明。
从视觉属性到VSA 按照假设完美感知的先前作品的相同程序[42,43],面板的属性标签直接由I-RAVEN元数据提供。对于每个属性a,每个面板的标签被转换为概率质量函数,其中i是面板的行索引,j是列索引。然后,面板的PMF被投影到VSA空间
其中N是属性a可以假设的可能值的数量。
VSA向量来自一个二进制广义稀疏块码(GSBCs)[44] C = {bi}的字典512i=1。在二进制GSBCs中,D维向量被分成B个长度相等的块,L = D/B,每个块中只有一个(随机选择的)元素被设置为1(D = 1024,B = 4)。
二进制GSBCs上的代数操作在表1中定义。将GSBCs与分数幂编码(Fractional Power Encoding, FPE)[45]结合,允许在相应的向量空间中表示连续属性(例如颜色或大小)和简单的代数运算,如加法和减法。换句话说,FPE初始化允许在高维向量和实数之间建立语义等价。这个属性在框架中被一致利用,因为它允许将谜题中的类比作为实数域中的简单代数运算来解决。最后,我们观察到二进制GSBCs的绑定操作具有类似于实数域中加法的属性,包括交换律、结合律以及中性元素的存在(e ∈ C,使得a ⊛ e = a ∀a ∈ C)。
学习RPM规则作为一个分配问题。Learn-VRF中引入的核心思想是,RPM中使用的规则可以框架在一个固定的模板中,该模板包括一系列绑定和解绑操作。
执行和选择学习的规则。使用学习到的规则集进行推理是一个两步过程:执行步骤(在此步骤中,所有规则并行应用于输入)和选择步骤(在此步骤中,为缺失面板生成预测)。将每个规则 r 应用于 RPM 示例会生成一个包含三个 VSA 向量 的元组,该元组对应于规则在 RPM 矩阵的三行上的执行结果,以及一个规则置信度值 sr。置信度值计算为预测 VSA 向量与其各自的真实向量之间余弦相似度之和。
在推理过程中,求和的最后一项(i = 3)被省略了,因为第三行的真实情况是未知的。
最终的答案是通过对所有规则执行生成的VSA向量进行线性组合得到的,这些向量根据它们各自的置信度得分加权(使用softmax函数归一化到有效的概率分布)。更正式地说,如果我们定义s = [s1, ..., sR]为所有规则的置信度得分的连接,并且定义为所有规则对缺失面板的预测的连接,那么模型为属性a预测的最终VSA向量
使用加权组合可以被理解为规则之间的软选择机制,与通过抽样提供的硬选择机制相比,被发现更为有效。
3 方法
在这一部分,我们介绍了我们的具有上下文感知能力的演绎规则学习器(Abductive Rule Learner with Context-awareness, ARLC)系统。ARLC的概览如图1所示。该框架在概念层面上与原始的Learn-VRF保持一致,尽管进行了关键调整,以提高其表达能力,并在I-RAVEN数据集上提升其下游性能。
3.1 学习上下文增强的RPM规则
在方程2中提出的软分配问题旨在为方程1中的每个项ci分配一个固定的、绝对的位置在3×3的RPM矩阵中。例如,算术减法规则可以被学习,使用一位有效分配权重作为。这种方法的一个主要限制是规则不能在RPM矩阵的行之间共享。例如,前述的算术减法规则仅对第三行有效,但对第一行和第二行无效。
为了克服这个限制,Learn-VRF同时实例化并学习三组不同的规则集(每行一个)。在推理过程中,模型利用前两组产生置信度值(方程3),然后使用这些值来执行第三组生成的输出面板的软选择(方程4)。虽然这种方法在实证上显示出有效性,但这种实现为不同的批评打开了大门。例如,模型对三个学习到的规则集之间的功能等价性没有约束。这使得模型的可解释性大大减弱,并增加了在规则选择机制中学习到错误相关性的可能性。
此外,这种公式化降低了模型的多功能性,因为其设计专门针对RPM环境,如果不重新配置其主要组件,就不能无缝转移到其他抽象推理任务。
受到这些问题的启发,并结合认知科学和心理学中的相关工作,这些工作认为上下文在人类解决类比问题中的重要性[46,47],我们提出了一个更通用的软分配问题公式,它抽象化了位置分配,而是依赖于上下文的概念。我们提议将方程2重写为
注意当前样本X及其上下文O的概念取决于所选择的用于推理的行,如图2所示。
与方程2相比,新的公式并没有损失表达能力。
虽然其项不再与RPM矩阵中的固定位置绑定,但通过在训练期间保持当前样本和上下文样本的顺序一致,仍然可以保留相对位置信息。模型可以正确表示行和列的关系。
最重要的是,新的上下文感知公式用于软选择,允许在RPM的所有行中共享一组规则。与Learn-VRF相反,模型现在可以通过构建强制执行选择和执行之间规则的功能等价性。此外,与Learn-VRF相比,可训练参数的数量减少了66%。
在RPM中,当前样本和上下文示例的数量分别等于I = 2和J = 5。我们不考虑J = 6个上下文示例,以确保可以跨行共享相同的规则。否则,当模型用于预测R1和R2时会失败,因为位置(3, 3)的面板是未知的。
3.2 通过模板泛化改进规则选择
与Learn-VRF相比,我们增加了通用规则模板(方程1)中的项数量,因为
提高规则模板的表示能力,开辟了学习更通用的RPM规则的可能性,同时在结构中包括“验证”项,这对于I-RAVEN数据集中的特定边缘情况是必要的,例如示例1。这弥合了Learn-VRF的鸿沟,Learn-VRF可以学习一套完美的执行规则,但对选择来说可能是次优的,以及其他神经符号方法[34,33],这些方法为选择硬编码了一套最佳规则集,为执行硬编码了另一套最佳规则集。我们定义规则集的最优性如下。
其中向量空间和R之间的等价性由FPE(分数幂编码)给出。
使用R进行选择可能会导致模型在这次RPM测试中失败。实际上,我们可以看到v+和vd3在前两行都会产生正确的答案,并且两者的置信度值(输出和真实属性之间的余弦相似度)都将为1。因此,模型将为两条规则分配相等的概率(即使只有一条是有效的),使得选择正确规则的概率等同于抛硬币。
在这种情况下,将验证项纳入分配三个的规则定义中可以解决这个问题。考虑功能等价的规则
最后两个额外项只有在第一个上下文行的元素之和等于第一列元素之和时才会相互抵消,这是分配三个规则总是满足的属性,但其他RPM规则则不然。因此,使用vd3++代替vd3,模型将能够将其从有效规则列表中排除,正确地将所有概率质量投入到算术加法规则中。请注意,仅使用方程1中可用的6个项,是不可能学习vd3++的。
因此,我们声称即使方程6在用于选择时仍然不是最优的,它也会增加模型对RPM边缘情况的鲁棒性。然而,表达能力的增加也以可训练参数数量的代价,这些参数的数量与方程6的项数成线性关系。
3.3 训练损失和其他实现方面
我们遵循 Learn-VRF [39] 提供的训练方案。训练损失定义为三个预测面板与其相应的真实值之间的反余弦相似度
去除叠加还允许我们去除Learn-VRF中使用的键绑定,这些键是可训练参数,构成了模型的大部分参数(81%)。
4 结果
4.1 分布内(ID)结果
表2显示了ARLC在I-RAVEN上的分布内下游准确率与一系列神经符号和连接主义基线的比较。我们展示了三个不同版本的ARLC的结果:ARLCprogr,模型的权重是用RPM规则手动编程的(R = 4,因为常数可以被视为递进的特例),ARLCp7→l,模型用编程规则初始化,然后用梯度下降训练,以及ARLClearn,规则是从数据中从头开始学习的。
ARLC在分布内I-RAVEN数据集上实现了最佳平均准确率,比其他基线模型(NVSA [34],规则硬编码到模型中)提高了近5%,同时比其他任何基线模型的参数少得多。ARLC还显示出与其他基线相比,在几乎所有星座上更低的方差。
与其他所有方法(PrAE [33]除外)相反,ARLC仅在2x2星座上进行了训练,有效地将训练参数和训练样本数量减少了85%(6/7)。它对未见星座的无缝适应展示了学习规则的普遍性,但阻止了模型在每个单独星座上超越基线。
ARLC在所有没有位置/数量属性的星座上都产生了接近完美的结果(即C,L-R,U-C和O-IC),大大超越了GPT-3和PrAE。另一方面,它在包括位置/数量属性的星座上的准确率有所下降(即2x2,3x3和O-IG)。这种下降是因为位置属性上的三个特定规则:递进(对应于循环位移操作)、算术加(对应于逻辑操作a ∨ b)和算术减(对应于逻辑操作a∧¬b)。这些规则在对象的粒度上操作,不容易被以面板粒度操作的模型所捕捉。
最后,比较ARLC的三个提议版本,有趣的是ARLCp7→l超越了它的完全学习型和完全编程型等价物。编程后的训练允许扩展模型的知识,而不是像其他设置[40]中所示的完全擦除它,从而实现了下游准确率的单调增加。
表3报告了我们框架中引入的新颖性的彻底消融。我们可以观察到,最大的贡献来自于去除位置/数量叠加(+8.1%),它一致地提高了涉及这些属性的星座的性能。然而,在所有其他星座中,我们观察到准确率的一致下降,这是由于在“转移”设置中评估模型(在2x2上训练,在所有其他星座上评估)。这种下降被模型的两个新组件补偿了,即上下文感知和通用规则模板,它们允许ARLC在每个星座上与Learn-VRF匹敌并超越它。有趣的是,它们还有助于减少结果的方差,这表明这两个改进可能增加了模型对权重初始化的不变性。
4.2 分布外(OOD)结果
我们通过遵循Learn-VRF [39]提出的相同方法来验证ARLC的分布外泛化能力:模型在中心星座的规则-属性对的子集上进行训练,并在其补集上进行评估。正如表4所示,ARLC与Learn-VRF之前展示的OOD性能相匹配,在中心星座的几乎所有未见规则-属性对上达到了完美的准确率。
5 结论和未来工作
在这项工作中,我们提出了具有上下文感知能力的演绎规则学习器(Abductive Rule Learner with Context-awareness, ARLC),这是一个基于Learn-VRF [39]构建的模型,旨在提高其下游准确性、可解释性、模型大小和一致性。我们在I-RAVEN数据集上进行了评估,证明了与多种神经符号和连接主义基线相比,在ID和OOD数据上都有显著的性能提升,包括大型语言模型。此外,我们还展示了模型可编程性的实证结果,以及在I-RAVEN数据集的不同星座间的泛化。
未来研究的一个潜在方向是解决数据集提出的剩余挑战,具体来说,是开发适当的表示,允许模型学习位置属性上的算术和递进规则。这些规则目前对模型来说是无法学习的,将允许它在I-RAVEN上实现完美的准确性。此外,将ARLC的评估扩展到包括其他推理基准测试,如ARC [3],也是进一步研究的有希望的方向。事实上,虽然这项工作的范围主要集中在开发和研究一个原型上,它可以解决RPM问题,但问题提出的一般公式可以转移到其他需要关系和类比数据驱动学习的场景。此外,正如我们在编程知识之上的学习实验所示,我们的框架在只有部分动态知识可用,并且需要在其上发现和构建新知识的场景中具有应用潜力。
热门跟贴