打开网易新闻 查看精彩图片

当VLA模型理解语言、感知环境并直接生成机器人动作,一个更基础的问题开始浮现:机器人如何理解一个持续变化的物理世界?物体从哪里移动而来、杯子此前遮住了什么、机械臂正在接近还是远离目标——真正决定下一步动作的信息,往往不只存在于当前一帧,而存在于连续的时间之中。

近日,大晓机器人联合香港大学发布全新的连续物理智能研究成果 StreamPI,直指VLA长期存在的“单帧智能”瓶颈,为其补上关键的“时间维度”。不同于传统VLA主要依据当前观测独立决策,StreamPI 为模型建立持续的多模态时序上下文,使机器人能够记住过去、理解状态变化、判断任务进程,并利用跨帧信息增强精细空间感知与动作决策。它推动VLA从“识别当前状态”,进一步走向“理解一个正在发生的物理过程”。

VLA会“看”和“做”,但还需理解“发生了什么”

以π0、π0.5 为代表的新一代VLA,正不断拓展机器人在开放环境中的泛化边界。π0.5已能够在训练未见过的家庭环境中完成厨房、卧室清洁等10-15分钟的长程多阶段任务,机器人基础模型正在从单一技能执行走向更复杂的开放世界操作。

大晓机器人加速物理AI迎来“开悟时刻”
打开网易新闻 查看精彩图片
大晓机器人加速物理AI迎来“开悟时刻”

但StreamPI直指 VLA 更底层的能力缺口:当前大量模型仍依赖单帧决策,能够判断“眼前是什么”,却难以持续理解“此前发生了什么”。缺少历史上下文,不仅限制机器人的时序记忆,也使其难以利用运动视差、状态变化等跨帧线索形成更准确的三维空间判断。这也是当前流式感知与实时 VLA 研究持续关注的问题。

一个最直观的例子是“猜杯子”:物体被藏入杯子并经过多次交换后,答案已不存在于最后一帧,而存在于整个变化过程;面对滚动物体,单帧只能判断“它在哪里”,连续观测才能理解“它正往哪里去”。当关键信息存在于时间之中,机器人需要的不只是看见当下,更要理解过程。

不是简单“多看几帧”,而是从窗口式走向流式

给VLA加入时间信息,最直接的方法是把过去多帧图像组成一个窗口,一次性交给模型。但历史越长,视觉信息越多,不仅需要反复计算已经处理过的画面,推理开销持续增加,任务指令也更容易被大量视觉信息稀释,导致机器人在长程执行中逐渐“忘记目标”。

StreamPI没有简单堆叠历史帧,而是将每个时刻组织为一个完整的“视觉观测 + 任务指令”时序单元。语言指令持续绑定每一次观测,成为贯穿任务始终的语义锚点,让机器人在不断接收新信息的同时,始终明确“正在做什么、目标是什么”。

大晓机器人在零售场景上的应用
打开网易新闻 查看精彩图片
大晓机器人在零售场景上的应用

在每个时序单元内部,视觉与语言充分交互;不同时间单元之间,则按照时间顺序持续读取和聚合历史信息。由此,模型既能理解“这一刻看到了什么”,也能追溯“此前发生了什么”,将原本离散的单帧判断连接成连续的时序理解,实现帧内解决“这一刻看到了什么”,帧间解决“此前发生了什么”。

让机器人拥有记忆,并不意味着每次决策都要重算全部历史。StreamPI 采用流式推理:首帧观测被编码后存入键值缓存,后续只需处理新到来的信息,并直接调用历史表示,避免重复计算整个观测窗口。

随着机器人持续行动,新信息不断写入、历史信息持续保留,当前决策始终建立在此前状态之上。与此同时,StreamPI 无需额外引入视频编码器或独立记忆模块,而是通过重构原有VLA的注意力机制,直接继承 π0.5 的视觉—语言表征能力,在不增加额外模型参数的情况下,让单帧 VLA 获得连续时序能力。

真机验证:当“时间”真正改变动作结果

团队进一步设计四项真机任务,分别检验时序记忆与精细空间感知,每项任务采集 100 条人类遥操作示范。在需要持续记住杯子交换轨迹的“猜杯子”(Shell Game)任务中,StreamPI 将 π0.5 的成功率从 46.7%提升至80.0%;在需要判断物体运动趋势的滚动物体抓取中,则从 26.7% 提升至63.3%。差距不在于机器人能否“看见”杯子和瓶子,而在于它能否理解此前发生了什么,以及物体接下来可能去哪里。

在强调空间精度的任务中,效果同样明显。在窄瓶口插笔任务中,成功率从 40.0% 提升至 66.7%;纸杯插入杯套任务则从 60.0% 提升至 92.0%。连续观测带来的运动视差、相对位移和状态变化,让机器人获得单帧图像难以提供的几何线索——时间不仅带来记忆,也在帮助机器人更准确地理解空间。

真实世界任务可视化与真实机器人性能对比
打开网易新闻 查看精彩图片
真实世界任务可视化与真实机器人性能对比

StreamPI 真正探索的,并不只是“为 VLA 增加历史信息”,而是推动机器人从基于当前状态决策,走向基于连续过程决策:现实世界不再是一组彼此孤立的静态画面,而是一条可以被记忆、理解和持续更新的时间流。

大晓机器人是加速具身智能智慧跃迁的机器人公司,由商汤科技联合创始人、执行董事王晓刚出任董事长,世界级AI科学家陶大程院士担任首席科学家,公司汇聚全球稀缺的青年AI科学家及来自产业界的卓越专家。

空间告诉机器人“物体在哪里”,时间告诉机器人“世界正在发生什么”。未来,团队将探索超过 100 帧的高效时序训练与自适应缓存裁剪,将机器人的时序理解进一步延伸至更长、更复杂的真实任务。

原标题:《让VLA真正理解时间,香港大学联合大晓机器人发布连续物理智能研究成果》