麻省理工学院、哈佛大学和耶鲁大学的研究人员发现了人工智能(AI)训练领域的一个悖论,这可能代表着加速机器人智能的突破。
根据他们的论文“室内训练效应:过渡函数分布变化带来的意外收益”,他们发现,在安静、受控的环境中学习的人工智能系统在现实世界中部署时,有时表现优于在嘈杂、不可预测的条件下训练的人工智能系统。
这就像说,一个在安静的网球场上训练的网球运动员,在真正的网球比赛中,尽管有风,有观众在背景中咆哮,但他会比另一个在现实世界条件下训练的运动员表现得更好。
但这正是研究人员发现的。
他们在论文中写道:“令人惊讶的是,我们发现,在某些条件下,在无噪音环境中进行训练,在嘈杂环境中进行测试时,表现会更好。”噪音是指任何人在与现实世界互动时都可能遇到的不确定因素。
这种“室内训练效应”挑战了人工智能训练的传统观念。传统观念认为,在与实际部署情况相同的环境中进行训练将获得更好的性能,因为它们已经知道会发生什么。
研究人员发现,情况恰恰相反。这是因为在安静、受控的条件下训练人工智能可以让它掌握基础知识,然后可以更好地应用于现实世界。与直觉相反的是,这比在类似现实世界的混乱条件下训练的人工智能表现更好。
这对机器人意味着什么
这一发现有助于改善机器人的训练。像仓库中部署的机器人一样,机器人通常必须在嘈杂、繁忙的环境中工作。人们认为,为了让机器人在真实情况下表现良好,它们需要在类似的繁忙和嘈杂环境中接受训练。但训练这些机器人的挑战在于难以在实验室中复制真实世界的条件。
研究小组的发现可以使机器人的训练变得更加简单:机器人可以被放置在安静、平和的环境中,比如实验室中,然后放置在混乱的现实世界中,它们的表现仍然比在嘈杂环境中训练的机器人更好。
他们写道,“机器人系统可以在简化、受控的环境中接受训练,以掌握不受噪音干扰的基本技能”,而且这种训练还可以“增强机器人在不可预测性和噪音普遍存在的现实条件下的适应和执行能力”。
研究人员进一步表示,这些训练策略可以打造出“更加强大、适应性更强的机器人,能够在多样化和不断变化的情况下有效地导航和执行任务”。
根据 Nvidia 的一篇博客文章,传统上,机器人是通过预先编程来训练的。“这些机器人在预定义的环境中取得了成功,但在应对新的干扰或变化时却举步维艰,缺乏动态现实世界应用所需的稳健性。”然而,人类训练师在训练机器人的过程中确实会添加“噪音和干扰”,以便这些机器能够“学会对意外事件做出良好反应”。
但让机器人更加通用的技术正在开发中。上个月,麻省理工学院的研究人员创建了一个人工智能系统,该系统可以让仓库机器人处理形状奇特的包裹并在拥挤的空间中穿行,而不会对人类工人构成危险。
实验
这项研究考察了被称为强化学习 Agent 的人工智能系统的行为。这些 Agent 通过反复试验进行学习。传统上,强化学习 Agent 的训练条件与它们预期部署的环境非常匹配,以便表现良好。
该团队开始检验这一信念。他们在三款经典 Atari 游戏中测试了这些 Agent 的性能:吃豆人、乒乓球和打砖块。研究人员通过添加一些不确定性或噪音对游戏进行了修改。
研究人员还将 Agent 分为在相同嘈杂环境中进行训练和测试的可学习性代理,以及在安静环境中进行训练但在嘈杂环境中进行测试的泛化代理。
结果:即使在高噪音条件下,泛化 Agent 的表现也比可学习性 Agent 好几倍。
然而,研究人员警告称,他们的实验存在两个主要局限性。他们只使用了 Atari 游戏,还从经典强化学习方法中得出结论,但不确定这些结论是否也适用于深度强化学习方法。
免责声明:
本文所发布的内容和图片旨在传播行业信息,版权归原作者所有,非商业用途。如有侵权,请与我们联系。所有信息仅供参考和分享,不构成任何投资建议。投资者应基于自身判断和谨慎评估做出决策。投资有风险,入市需谨慎。
关注我们,一起探索AWM!
2025-02-01
2025-01-15
2024-12-14
热门跟贴