一个模型,能控制机器人、开车、打游戏、还能飞无人机。这听起来像是把四个不相干的活儿塞进同一个大脑里。
它靠什么干活
打开网易新闻 查看精彩图片
逻辑其实很直接:模型先从真实世界里拿到视觉观察,再基于这些观察做出动作。没有为机器人单独写一套规则,也没有为开车单独训一个模型,视觉输入是它理解世界的统一入口。
换句话说,机器人看到的、汽车看到的、游戏画面里呈现的,在它这里被当成同一类东西处理——都是画面,都要从画面里读出下一步该做什么。
为什么这件事值得多看一眼
过去这类任务通常是各做各的:机器人一套系统,自动驾驶一套系统,游戏AI又是另一套。每换一个场景,就得重新搭一遍。
现在把视觉观察作为共同起点,一个模型覆盖四种完全不同的载体,至少说明这条路是走得通的。至于它在这四件事上分别做到什么水平,目前还没有更多细节。
热门跟贴