打开网易新闻 查看精彩图片

由中国企业改革与发展研究会、网易财经、网易财经智库联合主办的2026网易经济学家年会・夏季论坛于8月在深圳举行,本届论坛的主题是“智变・崛起”,北京大学汇丰商学院提供学术支持。

极佳视界联合创始人、首席科学家,通用世界模型北京市重点实验室主任朱政发表演讲,他的演讲主题为“世界模型:解锁无限的物理AGI生产力”。

朱政提出,世界模型与语言模型并列,核心是对未来物理状态进行预测,类似人大脑中负责预判风险的区域。他认为,过去三年语言模型将数字世界生产力提升了一个数量级,而现在具身智能、包括机器人的应用相对比较滞后,“工厂里面车间的工人可能每天只能工作8个小时,然后在家庭里面我们可能每天要每个人花费2-3个小时做家务,希望通过世界模型可以赋能机器人包括自动驾驶的车辆,在工业、泛服务和家庭场景解放物理AGI生产力。”

在朱政看来,世界模型的目标主要包含三点:第一,推动机器人通过物理图灵测试,在无需人工现场观察的前提下,外界无法分辨任务究竟由人还是机器人完成;第二,借鉴语言模型的工具化发展路径,让机器人、自动驾驶设备释放源源不断的物理生产力;第三,实现机器人自主完成设计、优化与制造,也就是“机器人造机器人”。

给机器人"喂"数据有多烧钱?朱政:真机采集200元/小时,几个亿砸进去都未必够
打开网易新闻 查看更多视频
给机器人"喂"数据有多烧钱?朱政:真机采集200元/小时,几个亿砸进去都未必够

他认为,当前语言模型、自动驾驶、具身智能领域都高度关注世界模型,因其能解决三大痛点:一是数据问题,真机数据采集每小时成本约两百元且泛化性、多样性严重不足,世界模型可生成低成本、高保真的泛化数据;二是评测问题,物理世界测试非常危险且耗时,世界模型可作为闭环仿真器进行评测和强化学习后训练,目前已可模拟约10分钟的未来演化;三是决策问题,VLA模型仅仅预测了未来世界的动作,而世界模型可模拟物理世界演化状态,并对采取动作后将受到的奖励或惩罚进行提前预测,让物理Agent像人一样持续学习、自我进步。

谈及技术迭代进度,朱政介绍,团队目前已经对外发布15款模型,整体处于类似2020年大语言模型的 “GPT1阶段”。他预计明年上半年推出对标 “GPT3阶段” 的新一代模型。团队搭建了覆盖数十类场景、上百种任务的大规模内部测试集,目标是该模型没有经过后训练的情况,就能在90% 以上的任务中取得超过90% 的成功率。

他表示,这些模型背后做了大量工程优化,构建了数字金字塔与算法金字塔。数字金字塔底层为海量互联网数据,中间层使用生成与合成数据,顶层为交互数据。与之配套的算法金字塔,底层借助海量互联网数据学习物理世界运行常识,例如杯子脱离桌面会受重力坠落,塑料杯不易摔碎、玻璃杯则容易碎裂这类基础物理规律。第二层引入动作数据开展动作对齐,实施监督学习与模仿学习;最后通过强化学习后训练,释放模型预训练能力,实现能力涌现。算法金字塔与之对应,底层通过海量互联网数据然后学习到物理世界运转的常识——例如杯子离开桌子会因重力坠落,塑料杯不会碎而玻璃杯会碎,中层引入动作的数据来进行动作对齐,进行监督学习或模仿学习,顶层通过强化学习后训练、解锁预训练能力,实现涌现效果。

机器人正在“造”机器人!朱政:2年内工厂里90%工序将高度无人化
打开网易新闻 查看更多视频
机器人正在“造”机器人!朱政:2年内工厂里90%工序将高度无人化

在应用落地方面,朱政表示已取得多项进展:家庭场景中,机器人叠一件衣服约20秒,基本上可实现连续叠几千件且不失误;泛服务场景中,无人咖啡店冲意式咖啡需十几个步骤,约1分钟一杯,每小时可做50杯左右;物流产线中,与苹果合作的手机装盒工序中,可实现把包装盒的两个“耳朵”精准卡入两个缝。其“机器人造机器人”计划目前已实现20%工序自动化,“预计经过两年时间后有望实现90%的工序高度自动化。”他表示。

朱政最后总结,模型竞争本质上是对组织和人才的考验。当前具身智能领域高端人才竞争激烈,“每年毕业的这些年轻人,最高的已经可以拿到千万年薪的Offer,如何将几百个高端人才聚集到一个组织中快速迭代模型,是一个新型命题”。