IT之家 8 月 13 日消息,具身智能公司 Dyna Robotics 发布新一代机器人基础模型 DYNA-2。该模型基于超过 100 万小时的第一人称人类视频进行训练,在基准任务中成功率高达 90%。 DYNA-2 官方定位为“世界动作模型”(World Action Model),核心思路是通过观察人类活动,学习动作如何改变物理世界。预训练阶段完全依赖人类视频数据,规模超过 100 万小时第一人称视频,相当于约 170 年的人类经验。 公司联合创始人 Jason Ma 指出,通用机器人长期受制于数据瓶颈,人工采集的物理遥操作数据难以扩展到通用智能层面。DYNA-2 选择让模型观察人类活动,从中学习动作与物理世界变化之间的关系。 与传统视觉语言模型不同,DYNA-2 在采取动作前会先预测物理世界将如何运动,从而补足传统模型缺少的空间推理能力和接触物理能力。该模型通过两项训练目标同步学习:预测下一帧视频画面内容,以及预测应采取的动作,以此获取空间关系、运动方式以及物体受接触后的响应规律。 Dyna Robotics 公布的实验结果显示,随着预训练阶段加入的人类视频数据不断增加,机器人在 15 项基准任务中的表现持续提升。该公司将此现象称为“人到机器人的缩放规律”,即模型性能会随训练数据规模扩大以相对可预测的方式增长。 值得注意的是,在 1 项实验中,仅需 13 分钟机器人专用数据,就能让两只 5 指机器人手学会拧开瓶盖。在制造任务中,保持后训练数据集不变的情况下,任务成功率随预训练规模增加,从约 20% 提升至 80% 到 90%。 Dyna Robotics 还透露,DYNA-2 在一次客户部署中取得了 87% 的质量通过率,而上一代产品 Dyna-1 为 46%。在需要根据用户指令执行不同动作的任务中,视频协同训练使得分提升了 133%。
热门跟贴