打开网易新闻 查看精彩图片

具身智能机器人也可能率先进入家庭,再随着能力与可靠性提升,逐步进入工厂。”生数科技创始人朱军在近日举行的2026世界机器人大会(WRC 2026)上表示。

在朱军看来,如果机器人能够先在家庭中建立大规模使用与数据闭环,再将形成的通用能力迁移到可靠性要求更高的工业环境,那么具身智能的商业化路径,或许不只有“先工厂、后家庭”这一种答案。

家庭可能率先成为应用场景,并不意味着家庭任务比工业任务更简单。相反,家庭环境高度非结构化,物品、人员和任务随时发生变化,对泛化能力提出了更高要求。但从产品落地角度看,家庭和工厂面对的可用门槛并不相同。

工业生产强调节拍、精度、稳定性和连续运行。一项任务即使成功率达到90%,剩余的失败也可能导致产线停顿、产品损坏或安全事故。因此,工厂不仅要求机器人会做,还要求其长时间、可预测地把任务做对。

家庭对部分任务的容错空间相对更大。机器人即使暂时只能完成收纳、取物、清洁等有限任务,只要能够持续提供价值,也可能形成早期产品。它可以在真实使用中积累数据、改善能力,再逐步承担更复杂的任务。

因此,“先家庭、后工厂”并不是按照环境复杂程度排序,而是按照产品可用门槛和模型成长路径排序。家庭既可能成为应用场景,也可能成为机器人持续学习真实世界知识的重要数据来源。

朱军认为,具身智能的发展不能只看机器人能否完成某项动作,更要看模型是否能够理解环境、预测变化,并据此采取行动。

这一路径可以概括为“理解、预测与行动”的统一。机器人首先需要理解当前世界的状态,随后预测不同动作可能产生的后果,最终根据反馈调整行为,形成持续闭环。如同人类学习骑车或驾驶时,也是在不断预测动作后果,并依据真实反馈修正判断。

支撑这一路径的核心,是通用世界模型。朱军将其发展划分为五个阶段:首先生成世界,随后与世界交互,继而在世界中行动,再走向自主探索,最终组织多个智能体共同塑造世界。

目前,生数科技从视频生成模型Vidu向世界动作模型Motus、Motubrain延伸。视频预训练帮助模型吸收世界知识,统一架构则尝试打通感知、想象与行动,使模型获得跨视角、跨本体和跨任务迁移能力。

在数据层面,互联网视频、人类第一视角视频、动作示范、真机交互以及合成数据并不是彼此替代的路线,而是共同组成数据金字塔。越接近真实机器人交互,数据越稀缺、成本越高,却也越能帮助模型完成从看懂世界到作用于世界的对齐。

WRC2026期间,朱军在《具身智能大模型的进化之路:从技术分级到产业落地》论坛上发表演讲。

以下为「明亮公司」整理的朱军题为《通用世界模型:第一性原理与发展路线》演讲内容精编(未经演讲人审阅):

打开网易新闻 查看精彩图片

#01 世界模型是通向通用具身智能的关键

今天想和大家探讨通用世界模型的第一性原理,以及它未来可能的发展路线。过去几年,生成式人工智能快速发展。大语言模型让机器具备了理解和生成语言的能力,视频生成模型则让机器开始学习视觉世界的变化规律。

但如果希望人工智能真正进入物理世界,仅仅生成文本、图像或视频还不够。模型还必须理解环境、预测未来,并通过行动改变世界。

从这个角度看,世界模型不是一个单纯的视频生成器,也不是一个独立的机器人策略,而应该成为连接理解、预测与行动的统一基础。

人类掌握一项技能,本质上并不是记住一组固定动作,而是在不断预测动作可能产生的结果,并根据真实反馈持续修正。

以骑自行车为例,人在骑行过程中,需要先理解当前环境与自身状态,再预测不同动作可能带来的结果,最后根据反馈及时调整方向和姿态。整个过程并不是一次性完成的,而是在理解、预测、行动和反馈之间持续循环。

因此我认为,技能的本质是持续预测。首先,要看见并理解当下,包括环境、物体和自身状态;其次,要预测未来,比较不同动作可能产生的结果;最后,要从真实世界获得反馈,不断校准判断。

如果机器人只能根据当前输入直接输出动作,它很难应对动态变化的环境。只有具备预测能力,机器人才能从简单的模式匹配走向规划,并逐步形成真正的技能。

打开网易新闻 查看精彩图片

基于这一认识,我们把通用世界模型概括为三个相互反馈的能力:理解、预测和行动。理解,是推断当前世界的状态;预测,是想象不同动作对应的未来;行动,则是对物理世界进行干预,并产生新的观察和反馈。

这三个部分不是彼此割裂的模块。机器人每完成一次行动,世界就会产生新的状态;新的状态又成为下一轮理解和预测的基础。只有建立这样的实时闭环,模型对物理世界的认知才可能不断修正。

所以,通用世界模型不是单一的生成器、模拟器或机器人策略,而是理解、预测和行动三种能力在反馈中形成的统一基础。

打开网易新闻 查看精彩图片

构建通用世界模型需要数据、架构和算力

要构建通用世界模型,需要解决三个基础问题:数据、架构和算力。

第一个要素是数据。数据决定模型能够获得多么广泛的世界经验。具身智能面对的是开放的物理世界,不可能只依赖某一种来源的数据。模型既需要互联网规模的视频数据,也需要专业领域视频、人类第一视角视频、机器人示范数据以及真机与环境交互产生的数据。

第二个要素是架构。架构决定模型学习到的知识能否在理解、预测和行动之间迁移。如果视觉理解、视频生成和机器人控制分别由不同的模型完成,彼此之间缺少统一的表示,知识就很难共享。我们希望建立一种统一架构,让不同模态、不同任务和不同机器人本体能够使用共同的世界知识。

第三个要素是算力。算力不仅决定模型能否完成大规模预训练,也决定模型能否进入真实世界的实时控制闭环。机器人不是离线生成一段视频,而是要在运动过程中持续感知、预测和行动。如果推理速度达不到实时控制要求,再强的模型也无法真正进入物理世界。

打开网易新闻 查看精彩图片

#02 世界知识不能只从机器人数据中获得

具身智能目前面临的一个突出问题,是机器人数据规模远小于互联网文本和视频数据。

如果所有能力都依赖机器人真机采集,成本会非常高,数据的场景覆盖也会受到限制。人类学习一项技能,并不只依赖亲自反复尝试,也会通过观察他人的行为获得经验。机器人也需要具备类似的“Learning by Seeing”能力。

视频数据包含大量关于世界的知识,物体如何运动,人怎样使用工具,动作如何改变环境,不同事件之间存在怎样的因果关系。通过大规模视频预训练,模型可以先建立对世界的基本理解,再将这些知识迁移到机器人行动上。

打开网易新闻 查看精彩图片

我们提出了一个五层数据金字塔

第一层是互联网规模的视频数据。这类数据覆盖范围最广,能够帮助模型学习基本语义和观察到的世界动态。

第二层是经过筛选的领域视频和教学视频。它们包含更加清晰的任务结构,以及语言、音频和事件等信息。

第三层是人类第一视角视频。这类数据能够呈现人的手、工具、物体可供性,以及以行动者为中心的环境变化。

第四层是带有动作记录的示范数据,包括同步的观察、动作与触觉信号。

第五层是真实机器人与环境交互产生的数据,能够提供动作、结果与物理反馈之间最直接的对应关系。

越接近金字塔顶部,数据与机器人任务、本体和动作的对齐程度越高,但规模越小、成本也越高。因此,不能只使用最顶部的机器人数据,而应该让不同层级的数据共同服务于模型训练。

仿真数据也可以补充各个层级,包括生成世界轨迹、扩展任务和多模态变化、合成第一视角数据、重定向动作轨迹,以及覆盖真实世界中难以采集的极端情况。

与此同时,失败尝试、探索行为和纠正动作等“不完美数据”也具有重要价值。这些数据能够为模型提供因果结构、干预效果、约束条件以及失败恢复等学习信号。

打开网易新闻 查看精彩图片

#03 通用世界模型将经历从生成到组织的五级演进

我们把通用世界模型的发展划分为五个阶段:生成、交互、行动、自主和组织

第一级是生成世界。模型能够生成像素、视频和数字世界中的想象内容。Vidu所代表的视频生成模型属于这一阶段。

第二级是交互世界。模型不再只生成预先确定的内容,而是能够接受用户实时输入,并持续改写未来。我们推出的Vidu S1,希望探索的就是这种可实时介入、持续演进的交互式世界。

第三级是行动于世界。模型能够把对世界的理解和预测转化为物理行动,机器人由此进入真实世界。Motus和Motubrain所代表的世界动作模型属于这一阶段。

第四级是自主世界智能体。系统不再只执行人类指定的目标,而能够主动感知、规划、探索并持续学习。

第五级是世界组织者。多个智能体能够相互协作,共同组织任务并塑造物理世界。

这是一条从像素到交互、从交互到行动、再从行动走向自主与组织的连续路径

打开网易新闻 查看精彩图片

从生数科技自身的技术路线看,这也是一条从Vidu、Vidu S1走向Motus和Motubrain的连续路径。

Vidu负责生成世界,Vidu S1进一步支持人类实时介入和持续改写未来,Motus与Motubrain则把理解和预测转化为真实行动。视频预训练为模型提供世界知识,统一架构支持能力迁移,推理加速则让模型进入物理闭环。

#04 Motubrain统一理解、预测与行动

在Motus和Motubrain中,我们以潜动作作为连接世界理解与机器人行动的中介。模型需要具备三类能力:一是理解专家,负责理解语义、目标和当前状态;二是视频专家,负责四维时空建模和未来预测;三是行动专家,负责连续控制和动作分布。

这些能力不应该简单串联,而要在统一的潜在表示中共享知识。为此,我们提出MoT架构,通过联合注意力机制把不同专家连接起来,并允许模型在像素解码和动作解码之间切换。

这样的架构可以支持多种查询方式。模型既能进行世界建模,也能预测动作、执行逆动力学推断、生成视频,或者联合预测视觉变化与机器人动作。

更重要的是,无动作视频、语言—视频对、合成动作和机器人轨迹,都可以训练同一个基础模型。这样,视频世界中的知识才有机会迁移到机器人控制中。

打开网易新闻 查看精彩图片

传统机器人模型往往依赖特定视角、特定本体和特定任务的数据,模型能力容易被固定的数据采集方式所限制。

Motubrain希望吸收多源异构数据和共享世界知识,实现跨视角、跨本体和跨任务三个维度的泛化。

跨视角意味着不同相机配置可以共享建模能力;跨本体意味着同一套世界知识可以迁移到不同形态的机器人;跨任务意味着同一个模型能够覆盖多种操作,而不必为每个任务重新训练独立策略。

这也是通用具身智能真正需要解决的问题,模型不应只记住某种机器人在某个场景中的运动轨迹,而要学习动作背后共同的物理规律。

#05 通用模型必须跨过实时控制门槛

模型能否理解世界,只是进入物理世界的第一步,它还必须达到实时控制所需的速度。

机器人与物理世界的交互是连续的。如果模型产生动作的速度过慢,环境已经发生变化,模型此前的预测就可能失效。因此,大模型必须留在实时反馈闭环中,预测才能真正转化为可执行控制。

在我们的实验中,Motubrain相较Motus获得了约10倍的加速,完整模型能够以5Hz运行,Video-to-Action模式可以达到11Hz。对于新的机器人本体,只需要约50-100条适配数据,便可以完成初步迁移。

我们在RoboTwin 2.0测试中观察到,模型在标准环境和随机环境中的成功率分别达到95.8%和96.1%。这些结果说明,世界知识、动作预测和实时控制可以逐渐被整合进统一模型中。

打开网易新闻 查看精彩图片

我们还观察到了多任务训练的规模化规律。随着任务数量增加,不同任务之间可以共享更多世界知识,模型在单项任务上的平均成功率也会提升。

这与传统机器人学习存在明显区别。过去,增加新任务通常意味着重新采集数据、设计策略和训练模型。在统一世界动作模型中,新任务不仅不会必然干扰旧任务,反而可能通过共享知识提升整体表现。

这意味着,具身智能的Scaling Law不应只理解为参数量或数据量增长,也包括任务数量、场景数量和本体数量的共同增长。

#06 具身智能可能先进入家庭,再进入工厂

谈到产业落地,很多人自然认为机器人应该先进入工厂,再进入家庭。但我认为,这个顺序未必是固定的,具身智能也有可能先进入家庭,再逐步进入工厂。

工业场景看起来更加结构化,但对稳定性、精度、节拍、安全性和连续运行能力的要求非常高。一台机器人偶尔完成任务,与它能够长时间稳定运行,是两件完全不同的事情。工业生产线通常要求接近确定性的成功率,任何一次失误都可能打断生产节奏。

家庭环境更加开放,任务也更加多样,但用户在部分场景中可能接受机器人先完成有限工作,再随着模型更新和持续学习逐步提升能力。机器人可以从收纳、递送、简单清洁或者辅助操作等任务开始,而不必在第一天就达到工业产线的稳定性标准。

因此,具身智能的落地路径不一定是简单的“先工业、后家庭”。家庭和工业可能沿着不同路线发展,也可能出现家庭应用率先形成规模、反过来积累数据和能力,再进入要求更严格的工业环境。

这仍然是一个需要产业继续验证的判断,但它提示我们,不能只依据环境是否结构化来判断落地先后,更需要比较场景对容错率、部署成本和能力迭代方式的要求。

#07 下一步是从行动走向自主与协同

目前,我们正在从第三级“行动于世界”向第四级和第五级推进。

下一阶段首先需要建立联合评测体系,同时衡量模型的理解能力、预测一致性、行动效果和迁移能力。

其次,模型必须理解物理因果关系,包括接触、摩擦、力以及动作干预产生的后果。如果模型只能拟合视觉变化,却不能理解行动为什么造成某种结果,就难以形成可靠的物理智能。

第三,系统需要建立持久且可以修订的记忆。机器人必须能够在跨分钟、跨天甚至更长时间内维护世界状态,并根据新的观察更新过去的判断。

第四,机器人需要具备自学习和自我进化能力,不再完全依赖人工提供任务和数据,而能够通过探索、交互和反馈持续改进模型与策略。

第五,模型需要实现高效的闭环部署,在性能、延迟和资源预算之间取得平衡。

最后是安全性和可控性。自主系统需要能够表达不确定性、接受约束,并保持整个决策过程可追踪、可审计。

打开网易新闻 查看精彩图片

从生成世界到与世界交互,再到行动、自主和组织,世界模型正在从数字内容生产工具走向物理智能基础设施。

我们希望通过视频预训练获得世界知识,通过统一架构连接理解、预测和行动,再通过实时推理把这些能力带入物理闭环。

只有当模型能够持续理解环境、预测未来、修正行动,并在不同任务、不同场景和不同机器人本体之间迁移时,通用具身智能才可能真正成为现实。