一个神秘的具身智能团队,最近放出了一批内部模型MVP(Make Veritable People)的演示视频。这批视频没有发布会,没有技术论文,只有几个长镜头,却让不少看过的开发者开始讨论一个问题:具身智能是不是快要迎来自己的“ChatGPT时刻”了?

这个判断听起来有点大胆,但看完演示内容,你会发现讨论并非空穴来风。团队在演示中传递的核心观点是:机器人不是在“猜”下一步动作,而是真的在理解物理约束、人类习惯,以及自己身体的能力边界。换句话说,它知道自己能做什么、该怎么做,以及怎么做更省力。

打开网易新闻 查看精彩图片

五个演示,五个维度的能力切片

这批演示一共五段,每一段都指向一个具体的能力维度。第一段展示的是手眼协调与动力学理解。机器人一只手端着水杯,另一只手去扶住正在倒下的易拉罐。这个动作看起来简单,但难点在于:扶罐子的同时,端水的手不能洒出水来。这意味着机器人需要在极短时间内,同时处理两个不同物体的动态变化,并且基于对物理规律的内部建模来做出反应,而不是机械地执行预设动作。

第二段演示更贴近日常生活:机器人对一个客厅进行零样本整理。它没有经过特定场景的训练,却能完成一系列复杂操作——把物品放回原位、在光滑地板上拖动篮子、挂起环形物体,甚至会把靠垫直接扔到沙发上。最后这个“扔”的动作尤其值得注意,因为从效率角度看,走过去放好和隔空扔过去,后者显然更省力。机器人选择了后者,说明它在规划动作时,会主动评估不同方案的能耗成本。

跨形态协作与“省力”逻辑

第三段演示展示了跨形态协作能力。两台结构完全不同的机器人,合作完成抖平床单的任务。它们没有各自为战,而是共享同一个策略逻辑,在保持人类熟悉的家务动作逻辑的同时,实现了不同身体结构之间的协同。这种能力指向一个更深的可能性:一个统一的策略模型,或许可以跨越硬件差异,直接部署在不同形态的机器人上。

第四段演示则揭示了动作选择背后的能量驱动逻辑。面对一堆需要搬运的物品,机器人没有选择一件一件来回跑,而是一次性抱起多件物品,甚至把自己的身体当作临时收纳架。这种“批量处理”的行为模式,反映出它的动作策略在追求更低能耗、更长周期的解决方案,而不是机械地执行“拿一件、送一件”的简单循环。

这些能力意味着什么?

把五个演示放在一起看,MVP模型呈现出几个贯穿始终的特征:动作的一致性、对长周期任务的持续完成能力、对物理环境的感知,以及一种带有“个人风格”的行动方式。这种风格感尤其微妙——它让机器人的行为看起来不是随机拼凑的,而是有一个内在逻辑在驱动。

当然,这些演示都发生在受控场景中。团队没有公布模型参数、训练数据规模,也没有展示在开放环境中的泛化表现。演示视频里展现的能力,能否在真实家庭环境的混乱中同样成立,目前还没有答案。所有性能声明均来自QbitAI的原始报道及其采访的模型团队,尚未经过第三方独立验证。

但一个值得注意的信号是:这个团队选择用“长镜头”而不是“剪辑拼接”来展示能力,这本身就是在回应外界对AI演示视频真实性的普遍质疑。如果这些行为确实能泛化到受控场景之外,具身智能距离真正有用的日常自主性,可能比很多人想象的要近一些。