通过潜在贝叶斯惊奇的好奇心驱动的探索

Curiosity-Driven Exploration via Latent Bayesian Surprise

https://arxiv.org/pdf/2104.07495

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

摘要

人类追求知识的内在欲望,即好奇心,被认为在技能获取过程中至关重要。借助人工好奇心,我们可以为当前的控制技术(如强化学习)赋予更自然的探索能力。在这方面,一个有前景的方法是利用模型参数上的贝叶斯惊奇,即先验信念与后验信念之间差异的度量,来促进探索。在本研究中,我们提出在表示智能体对系统动力学当前理解的潜在空间中应用贝叶斯惊奇,从而大幅降低计算成本。我们通过衡量智能体在连续任务中的环境探索表现,以及在视频游戏中获得的游戏分数,来全面评估我们的方法。我们的模型计算成本低廉,并在多个问题上与当前最先进的方法相比表现良好。我们还研究了环境中的随机性所造成的影响,这通常是好奇心驱动智能体的失败案例。在该情况下,结果表明我们的方法对随机转移具有鲁棒性。

1 引言

智能体可以通过强化学习进行训练,通过最大化奖励信号来成功完成任务,该奖励信号鼓励正确行为并惩罚错误动作。例如,智能体可以通过最大化游戏分数来学习玩视频游戏(Mnih 等,2015),或通过遵循人工设计的奖励来完成机器人操作任务,例如解魔方(OpenAI 等,2019)。然而,如何正确定义奖励函数以发展通用技能仍然是一个未解决的问题,并且在为复杂任务设计奖励时很可能会遇到不良行为(Amodei 等,2016;Clark 和 Amodei,2016;Krakovna 等,2020;Popov 等,2017)。

与强化学习智能体不同,人类可以在没有外部奖励的情况下学习行为,这是由于内在动机自然驱使他们积极主动地探索环境(Larson 和 Rusk,2011;Legault,2016)。为强化学习智能体设计类似机制,为在没有外部奖励的情况下训练和评估智能体开辟了可能性(Matusch, Ba, 和 Hafner,2020),从而促进更多自我监督的学习策略。

将内在动机,即“好奇心”,注入人工智能体的想法在强化学习社区引起了广泛兴趣(Oudeyer, Kaplan, 和 Hafner,2007;Schmidhuber,1991),其中好奇心被用来生成替代或补充外部奖励函数的内在奖励。然而,什么是生成内在奖励的最佳方法仍未确定,当前技术在某些领域表现不佳,例如随机或模糊环境(Wauthier 等,2021)。

几种成功的方法将内在奖励建模为模型的“惊奇度”。通俗地说,这可以描述为智能体对环境状态的信念与真实状态之间的差异,并且可以实施为模型的预测误差(Achiam 和 Sastry,2017;Pathak 等,2017)。然而,搜索不太可预测的状态会遇到“噪声电视问题”,即观看输出随机白噪声的屏幕似乎比其他探索行为更有趣(Schmidhuber,2010)。这是因为电视的噪声是随机的,因此通常比环境的其余部分更有趣(Burda 等,2019a)。

相比之下,贝叶斯惊奇(Itti 和 Baldi,2006)衡量智能体在观察新数据后,其后验信念与先验信念之间的差异。正如我们在这项工作中也展示的,这意味着对于环境的随机转移,由于不携带更新智能体信念的新信息,会提供较低的内在奖励,从而可能克服噪声电视问题。先前采用贝叶斯惊奇进行探索的工作主要集中在评估模型参数空间中的惊奇(Houthooft 等,2016),这存在计算成本高昂的问题。

贡献。在这项工作中,我们提出了一种基于贝叶斯惊奇概念的新好奇心奖励。通过在任务动力学中建立潜在变量模型,我们推导出潜在贝叶斯惊奇,即潜在动态模型的后验信念与先验信念之间的差异。我们的动力学模型使用潜在空间中的随机变量来预测未来,同时捕捉任务动力学中的任何不确定性。

本研究的主要贡献如下:(i)一个潜在动力学模型,它在一个用于预测未来状态的未观测变量中捕捉环境动力学信息,(ii)一种新的贝叶斯惊奇启发的探索奖励,推导为关于动力学模型中潜在变量的信息增益,(iii)在多个连续动作机器人仿真任务和离散动作视频游戏上评估探索能力,并与其他探索策略进行比较,以及(iv)通过与动力学具有随机转移的任务上的其他基线进行比较,评估对随机性的鲁棒性。

实验结果经验表明,当环境大多是确定性时,我们的 LBS 方法要么与最先进方法表现相当,要么通常优于它们,使其成为一种非常有价值的探索方法。此外,与在参数空间中使用贝叶斯惊奇的方法类似,LBS 对随机性具有鲁棒性,并且在随机动力学问题中实际上比参数空间对应方法探索得更深入,同时计算成本也更低。更多可视化内容可在项目网页上查看。¹

2 背景

我们聚焦于使用探索奖励来激励强化学习中的探索。为便于读者理解,我们首先介绍标准符号和常用做法。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

3 潜在贝叶斯惊奇

我们的方法通过一个关于潜在变量计算的贝叶斯惊奇信号来提供内在动机。首先,我们描述潜在动力学模型如何工作,以及它如何允许在潜在空间中计算贝叶斯惊奇。然后,我们概述模型的不同组成部分,并解释它们如何通过利用变分推理来同时训练以拟合潜在动力学。最后,我们展示如何从模型的预测中获得LBS的内在奖励信号,并讨论与其他方法的联系。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

类似地,给定我们的潜在变量模型,我们可以训练一个动力学模型,以最大化未来状态对数似然的证据下界。为此,LBS模型由以下组成部分构成:

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

上式可以通过比较潜在先验和潜在后验组件所预测的分布来高效计算。所提供的信号应鼓励智能体收集那些预测更加不确定或错误的转移。

LBS的内在动机信号也可以重新表述为(为简洁起见,省略条件项):

打开网易新闻 查看精彩图片

其中左边项是潜在后验的熵,右边项是 p p相对于 q q的交叉熵。因此,最大化我们的奖励可以解释为寻找后验熵最小且后验与先验之间交叉熵值较高的状态。

假设 LBS 后验正确近似了系统动力学的真实后验,那么交叉熵项就与其他工作中采用的“惊奇度”奖励非常相似(Achiam 和 Sastry,2017;Pathak 等,2017;Burda 等,2019a)。因此,使用 LBS 可以看作是在最大化“惊奇度”的同时,试图避免高熵的随机状态。

4 实验

实验的目的是将 LBS 模型及内在奖励与强化学习中其他探索方法的性能进行比较。

环境。主要结果针对三组环境呈现:连续控制任务、离散动作游戏以及具有随机转移的任务。
连续控制任务包括经典的 Mountain Car 环境(Moore,1990)、基于 Mujoco 的 Half-Cheetah 环境(Todorov, Erez, 和 Tassa,2012)以及 Ant Maze 环境(见 Shyam, Jaśkowski, 和 Gomez,2019)。离散动作游戏包括 Atari 学习环境(ALE;Bellemare 等,2013)中的 8 款视频游戏以及 Super Mario Bros. 游戏,这是一款流行的 NES 平台游戏。随机任务包括一个具有随机动力学的图像预测任务以及 Mountain Car 的两个随机变体,其中包括一个类似噪声电视的组件。

在本节中,我们考虑仅优化其自监督信号进行探索的好奇智能体。这意味着我们通过设置 η e = 0 来忽略所有外部奖励(见背景部分)。这使得智能体完全专注于由好奇心机制激发的探索行为。对于所有任务,我们使用近端策略优化算法(PPO;Schulman 等,2017)来更新策略。对于模型的所有组件,我们使用神经网络。对于模型的潜在随机变量,我们使用分布层,这些层被实现为输出多元高斯均值和标准差的线性层。

零样本适应。我们在附录中提供了关于 Deep Mind Control 套件(Tassa 等,2018)的额外实验。与 Plan2Explore(Sekar 等,2020)类似,我们使用内在动机来训练一个探索策略,该策略收集数据以改进智能体的模型。然后,该模型被用于在环境奖励上训练一个利用性策略,并评估其零样本性能。在这些视觉控制任务中,我们表明 LBS 的内在动机奖励与基于模型的强化学习结合良好,达到与 Plan2Explore 相似或更高的性能,并且不需要训练额外的预测器。

4.1 连续控制

在我们的连续控制实验中,我们将状态空间离散化为区间,并比较所探索区间的数量,以覆盖率百分比来衡量。智能体能够访问某个区间,意味着该智能体能够解决需要到达状态空间特定区域的实际任务。因此,一个好的探索方法必须能够尽可能多地到达这些区间,这一点非常重要。

我们与以下基线方法进行比较:

  • 分歧(Disagreement,Pathak, Gandhi, and Gupta 2019):训练一个模型集合以匹配环境动力学。集合预测的方差被用作好奇心信号。

  • 内在好奇心模型(ICM;Pathak 等,2017):内在奖励计算为特征空间中动力学模型预测与真实特征之间的均方误差。状态通过一个特征网络处理为特征,该网络与模型联合训练以优化逆动力学目标。

  • 随机网络蒸馏(RND;Burda 等,2019b):特征通过一个固定的随机初始化神经网络获得。每个转移的内在奖励是下一状态特征与蒸馏网络输出之间的预测误差,该蒸馏网络被训练以匹配随机特征网络的输出。

  • 变分信息最大化探索(VIME;Houthooft 等,2016):动力学被建模为贝叶斯神经网络(BNN;Bishop,1997)。单个转移的内在奖励被塑造为在利用新转移数据更新网络前后,关于 BNN 参数计算得到的信息增益。

  • 随机(Random):通过执行一系列随机动作进行探索的智能体。注意,采用随机动作相当于在每个状态下具有最大动作熵的策略。因此,尽管其简单,随机基线提供了当不接收外部奖励时,最大熵强化学习方法探索深度的度量(Haarnoja 等,2018)。

我们发现 LBS 在此基准测试中表现最佳,因为它在所有任务中探索得最深入且最高效。训练曲线如图 3 所示,为使用八个不同随机种子运行的平均结果。与采用情节计数来调节探索的 RIDE(Raileanu 和 Rocktaschel,2020)和 NGU(Badia 等,2020b)的进一步比较见附录。

Mountain Car。在 Mountain Car 中,二维状态空间被离散化为 100 个区间。图 3 显示 LBS、VIME、ICM 和 Disagreement 都达到了相似的最终性能,覆盖率约为 90%。特别是,LBS 和 VIME 在前 30k 步中平均探索速度更快。RND 落后,仅访问了约 67% 的区间,仅优于随机基线(约 15%)。

Ant Maze。在 Ant Maze 环境中,智能体最多可以探索七个区间,分别对应迷宫的不同通道。LBS、ICM 和 Disagreement 在此环境中表现最佳,在 150k 步之前所有运行均到达迷宫终点。VIME 在所有运行中也达到 100%,但耗时更长。RND 和随机基线远低于 100% 覆盖率便趋于饱和。

Half-Cheetah。在 Half-Cheetah 环境中,状态空间被离散化为 100 个区间。在此任务中,其动力学相比其他任务最为复杂,LBS 达到了最多的区间数,覆盖率约为 73%。ICM 和 Disagreement 紧随其后,约为 60%,VIME 约为 49%。RND 落后,仅略优于随机基线(约 26% 对比约 17%)。

4.2 街机游戏

对于街机游戏而言,所选环境的设计方式要么要求玩家进行探索才能取得成功,例如《Qbert》,要么要求玩家尽可能长时间地生存以避免无聊,例如《Pong》。因此,智能体仅凭好奇心进行训练,但在一个回合内获得的游戏得分上对其进行评估,或者在《超级马里奥兄弟》的情况下,以从起始位置行进的距离作为评估指标。在该基准测试中,得分越高,意味着击杀的敌人数量越多、收集的道具越多,或者所探索的游戏过渡区域/场景/关卡越多,这意味着在该基准测试上表现更好的方法更有可能在环境中发现有意义的技能。将好奇心与环境奖励相结合,在这些游戏中的表现相比仅使用好奇心时有显著提升,但我们不与该设置进行比较,以便完全聚焦于探索性能。

我们遵循(Burda 等人,2019a)的实验设置,并与他们的基线方法进行比较,这些基线方法使用特征空间中的均方误差预测误差作为内在动机信号,即特征空间中的惊诧度。该特征空间是通过使用特征模型将环境中的状态投影到低维空间而获得的,即下一状态特征可以表示为

不同基线方法使用了不同的特征模型,因此:

  • 变分自编码器(VAE)模型:在训练动力学模型的同时,训练一个自编码器(如 Kingma 和 Welling 2014 所述);

  • 随机特征(RF)模型:使用随机初始化的网络;

  • 逆动力学特征(IDF)模型:使用能够建模环境逆动力学的特征。

对于 LBS,我们还发现,与高维像素空间相比,在降维后的特征空间中工作是有益的。为此,我们使用随机初始化的网络将环境中的状态投影到低维特征空间,这与 RF 模型类似。我们相信可以找到比随机特征更合适的特征,不过我们将这一想法留待未来研究。在该设置下,重建模型预测的是下一状态的特征,而非下一状态的像素:

附录中提供了使用像素重建与特征重建之间的性能比较。

训练曲线如图4所示,其中展示了(Burda等人,2019a)中基线的原始结果,以及LBS在5个随机种子运行下的平均值。实证结果有利于LBS模型,该模型在9款游戏中的5款中取得了最佳平均最终得分:Montezuma Revenge、Pong、Seaquest、Breakout和Qbert,且在后三款游戏中优势明显;而在所有其他游戏中,其表现与其他基线相当。

打开网易新闻 查看精彩图片

4.3 随机环境

我们的随机基准测试由三项任务组成:一项图像预测任务,我们在其中定量评估每种方法对确定性和随机转移所赋予的内在奖励;以及两项Mountain Car控制问题的随机变体,它们增加了一个由额外动作随机控制的附加状态。

Mountain Car中增加的这一低维状态可以看作是一个单像素的NoisyTV,由额外动作的遥控器控制。

图像任务。与(Pathak, Gandhi, and Gupta 2019)类似,我们使用带噪声的MNIST数据集(LeCun et al. 1995)来执行关于随机转移的实验。从MNIST测试集中选取样本,我们建立了一个虚拟动力学,该动力学总是从数字0或数字1的图像开始:0图像总是转移到1图像,而1图像则转移到一个代表2至9之间数字的图像(见图5a)。

打开网易新闻 查看精彩图片

我们根据从1图像开始的转移和从0图像开始的转移所提供的内在动机之比来评估性能。在观察到多个从1图像开始的样本之后,智能体应最终理解,与这种更随机的转移相关的结果并不会带来关于任务动力学的新信息,并应逐渐对其失去兴趣。因此,预期行为是该比率最终应趋向于接近1的值。

我们以128个样本为一批,均匀采样随机转移来训练模型,并使用十个随机种子运行实验。在图5b中,我们将LBS与Disagreement、ICM和RND进行了比较。我们观察到,LBS和Disagreement是唯一最终克服了从1图像开始的转移中随机性的方法,在收敛时保持了接近1的比率值。相比之下,ICM和RND在收敛时仍然认为随机转移更有趣。

打开网易新闻 查看精彩图片

我们对该环境的两个版本进行了实验:

  • FrozenOriginalState(冻结原始状态):当遥控器被触发时,无论对汽车施加多大的力,OriginalState都保持冻结。这使智能体能够专注于NoisyState的变化,同时不会损失汽车的速度和动量。

  • EvolvingOriginalState(演化原始状态):当遥控器被触发时,OriginalState会更新,但所施加的力为零。这意味着智能体必须决定是否放弃原始任务以专注于变化的NoisyState。

我们假设,在Frozen场景中,基于惊奇度的方法(如ICM)会对NoisyState进行采样,但也会广泛探索OriginalState,因为当智能体被噪声动作分散注意力时,通常将汽车向下推的重力被冻结,这对探索不构成障碍。实际上,我们看到ICM在Frozen问题上的平均性能优于Evolving设置,但仍受到随机性的强烈限制。

几种基线的平均状态空间覆盖率如图6所示。如图中的表格也突出显示的,LBS在随机环境的两种变体中仍然是最佳性能方法,对类似NoisyTV的随机性具有很强的鲁棒性。Disagreement和VIME也表现出对随机性的韧性,尽管探索程度低于LBS。ICM和RND的性能都因任务中的随机性而受到严重削弱。表格结果还显示,与原始非随机Mountain Car实验相比,LBS是探索性能降低最少的方法,而ICM是受噪声影响最大的方法。

打开网易新闻 查看精彩图片

5 相关工作

在表1中,我们将LBS与我们进行基准比较的所有方法(包括正文和附录中的)进行了对比。

打开网易新闻 查看精彩图片

强化学习。强化学习中基于价值的方法使用Q值函数在离散环境中选择最优动作(Mnih et al. 2015; Hessel et al. 2018)。然而,Q值方法无法很好地扩展到连续环境。策略优化技术通过直接优化策略来解决这一问题,既可以在线学习,使用从策略中采集的样本(Schulman et al. 2015, 2017),也可以离线学习,重用存储在回放缓冲区中的经验(Lilcarpa et al. 2016; Haarnoja et al. 2018)。

潜在动力学。在复杂环境中,使用潜在动力学模型已被证明对控制和长期规划是成功的,这些方法要么使用VAE来建模局部线性的潜在状态(Watter et al. 2015),要么在POMDP中使用循环世界模型(Buesing et al. 2018; Hafner et al. 2019, 2020)。

内在动机。几种探索策略使用动力学模型来提供内在奖励(Pathak et al. 2017; Burda et al. 2019b; Houthooft et al. 2016; Pathak, Gandhi, and Gupta 2019; Kim et al. 2019)。潜在变量动力学也被研究用于探索(Bai et al. 2020; Bucher et al. 2019; Tao, Francois-Lavet, and Pineau 2020)。状态表示中的最大熵也已用于探索,例如通过随机编码器用于RE3(Seo et al. 2021),以及通过原型表示用于ProtoRL(Yarats et al. 2021)。

对环境动力学建模的替代方法包括基于伪计数的方法(Bellemare et al. 2016; Ostrovski et al. 2017; Tang et al. 2017),这些方法使用密度估计技术来探索环境中较少访问的区域;随机先验函数(Osband, Aslanides, and Cassirer 2018),该方法将统计自助法和集成应用于Q值函数模型;以及噪声网络(Fortunato et al. 2018),该方法将噪声应用于价值函数网络的各层。

有些方法将基于模型的内在动机与伪计数相结合,例如RIDE(Raileanu and Rocktäschel 2020),它对影响状态表示的转移给予智能体奖励;以及NGU(Badia et al. 2020b),它用RND提供的内在奖励来调节伪计数奖励。值得注意的是,将NGU与智能体生命周期内的自适应探索策略相结合,使Agent57在所有Atari游戏中超越了人类表现(Badia et al. 2020a)。

规划探索。近年来,强化学习中关于探索的突破性进展也聚焦于利用学习到的环境动力学来规划探索行为。例如(Shyam, Jaśkowski, and Gomez 2019)和(Ratzlaff et al. 2020)中,他们使用动力学模型中的虚拟推演来规划探索行为;以及(Sekar et al. 2020)中,他们将潜在空间中的基于模型的规划器(Hafner et al. 2020)与分歧探索策略(Pathak, Gandhi, and Gupta 2019)相结合。

6 讨论

在本工作中,我们提出了LBS,一种新颖的方法,它利用潜在空间中的贝叶斯惊奇度为强化学习中的探索提供内在奖励。我们的方法已在多个连续控制和离散动作环境中被证明是成功的,在所有实验领域中均提供了可靠且高效的探索性能,并且对环境动力学中的随机性表现出鲁棒性。

在低维连续控制任务的实验中,我们评估了环境状态空间的覆盖率,结果表明我们的方法提供了比其他方法更深入的探索。LBS在Mountain Car和Ant Maze任务中提供了最有效和最高效的探索,并且在更复杂的HalfCheetah任务中显著优于所有方法。将LBS与VIME和Disagreement进行比较,我们证明了潜在表示空间中的贝叶斯惊奇度优于参数空间中的信息增益。

在街机游戏结果中,我们展示了LBS在高维环境中表现良好。通过在9款游戏中的5款中取得最佳表现,与几种基于惊奇度的基线相比,我们证明了LBS基于贝叶斯惊奇度的好奇心信号通常比惊奇度表现更好。

我们还从定性和定量两方面测试了LBS对动力学随机性的韧性。虽然其他基于参数空间信息增益的方法在随机环境中也表现出鲁棒性,但LBS在随机Mountain Car的两种变体中的探索性能都是无与伦比的。我们认为随机性是影响多种探索方法的重要限制,未来的工作应侧重于理解这些限制的适用程度以及如何克服它们。

原文链接:https://arxiv.org/pdf/2104.07495