IT时代网8月13日消息,具身智能公司 Dyna Robotics 发布机器人基础模型 DYNA-2,基于超过 100 万小时的第一人称人类视频训练,任务成功率最高可达 90%。

官方将 DYNA-2 描述为"世界动作模型",目标是通过观察人类活动,学习动作如何改变物理世界。其预训练完全依赖人类视频数据,规模超过 100 万小时第一人称视频,相当于约 170 年的人类经验。公司联合创始人表示,通用机器人长期受限于数据瓶颈,人工采集物理遥操作数据难以扩展到通用智能,而该模型通过观察人类活动来学习动作如何改变物理世界。

DYNA-2 在采取动作前先预测物理世界如何运动,为机器人补足了传统视觉语言模型缺少的空间推理与接触物理能力。模型通过预测下一帧画面内容与应采取的动作两项训练目标,获取空间关系、运动方式以及物体受接触后的响应等信息。

随着预训练数据增加,机器人在 15 项基准任务中的表现持续提升,公司称之为"人到机器人的缩放规律"。在一项实验中,13 分钟机器人专用数据就让两只五指机械手学会拧开瓶盖;制造任务里,在后续训练数据集不变的情况下,成功率随预训练规模扩大从约 20% 提升至 80% 到 90%。据公布,一次客户部署中质量通过率达 87%,上一代为 46%;在依指令执行不同动作的任务中,视频协同训练让得分提升 133%。

打开网易新闻 查看精彩图片

注:本文综合自IT之家等,文中包含AI辅助创作的内容。