打开网易新闻 查看精彩图片

7月21日,彭博社消息,北京极佳视界科技有限公司创始人兼CEO黄冠表示,公司就年内于香港交易所上市正进行讨论,且即将完成新一轮融资,投后估值约30亿美元。

那么,这究竟是一家怎样的物理AI公司?

©潮涌AI编辑部

大模型让数字世界的生产力翻了10倍乃至100倍,但物理世界的生产力还远未被解锁。

工人一天只能工作8小时,每个人每天花3-4小时做家务——如果机器人可以7×24小时完成这些任务,物理AGI的生产力将有多大?

过去一年,世界模型成了物理Agent领域最火的关键词,但世界模型究竟只是数据生成器,还是通往物理AGI的真正钥匙?

7月3日,极佳视界联合创始人、首席科学家朱政在“2026全球数字经济大会人工智能融合应用发展论坛”上以《世界模型:解锁无限的物理AGI生产力》为题,分享了极佳视界从VLA到世界模型的技术演进、产品矩阵,以及从2023年到2028年的物理AGI路线图。

打开网易新闻 查看精彩图片

以下是演讲实录,经潮涌AI整理发布:

三个目标

过去三年,语言模型不管用来做聊天、Coding还是Agent,都极大地增强了数字世界的生产力。

就像刚才CSDN蒋总讲的,在Claude Code出现之前,全球大概有1000万程序员可以用来写代码、做网页、做APP。Claude Code和Codex这类工具出现之后,全球可能又会有1亿乃至10亿开发者可以用写代码的技能来做应用——数字世界的生产力扩充了10倍乃至100倍。

与此对应的,极佳视界希望通过世界模型来赋能自动驾驶车辆,包括机器人,也就是具身智能,来提升物理世界的生产力。

在工业场景、商业场景乃至家庭场景,工人一天在工厂里可能只能工作8个小时,每个人在家庭里每天会花3-4个小时做家务。现在,我们要期待机器人可以7×24小时完成这些任务。

打开网易新闻 查看精彩图片

极佳机器人服务场景

展望未来,极佳视界希望同时做到三件事:

  • 第一,通过物理图灵测试。也就是说在一个房间里,如果我们不进入房间进行观测,其实没有办法分清楚这个任务是由真人完成还是由机器人完成的,我们就认为它通过了所谓的物理图灵测试。

  • 第二,无限的物理AGI生产力。对比Coding这种Claude Code工具,我们希望世界模型可以带来无限的物理AGI的生产力。

  • 第三“机器人造机器人”。仿照语言模型的Self-evolving,我们希望机器人也可以自主设计、制造和计划。通俗来讲,就是我们经常提到的“机器人造机器人”的这样一个计划。

从混合到纯世界模型的演进线

极佳视界是2023年6月成立的,到现在刚好三年,把自己定义成一家基础模型公司。

同时在做基础模型,包括GigaBrain VLA+世界模型系列、GigaWorld世界模型系列;另外在原生本体层面,同时做轮式双臂和双足本体;泛化场景上推进工业、泛服务和家庭场景。

除了具身智能和机器人,在自动驾驶和内容影视方向上也有布局。

打开网易新闻 查看精彩图片

极佳自动驾驶合作企业

现在大概2/3客户来自具身智能场景,包括老板电器、苹果、京东等,还有1/3来自自动驾驶,包括新能源车企、自动驾驶公司以及内容场景用户。

过去三年,机器人在本体运控层面以及电机、灵巧手、触觉传感器等方面取得了非常多进展。

今年整个行业可以进入通用模型的时代,包括具身大脑和具身数据的进展,当然这一切都建立在标准化的人形本体上,如双足式、四足式以及轮式双臂。期望未来本体+模型可以走向通用终端,在应用场景和应用产业链上取得更大进展。

极佳视界今年也牵头建设了通用世界模型——北京市重点实验室,希望从垂类世界模型(自动驾驶世界模型、具身世界模型、内容创作世界模型)出发,通过几年时间构建一个通用世界模型的系统和平台。

去年下半年极佳视界发布了VLA大模型GigaBrain-0,但做完之后在思考一个问题:是否应该按照语言模型或多模态模型的思路,直接在VLA上做Scaling?

通过大量实验发现,VLA因为需要把指令信息和视觉信息先转换成语言、和语言对齐之后,再解码成Action,这个过程非常低效,是有信息瓶颈的。

打开网易新闻 查看精彩图片

GigaBrain-0测试

于是,在寻求更高效的模型架构和协议方式,找到了世界模型。

第一个世界模型平台是去年12月发布的GigaWorld-0,主要作用是可以生成海量的泛化数据,包括颜色、纹理、光照、视角、动作的泛化数据。

最近推出了新一代GigaWorld-1,除了做数据生成之外,更重要的可以作为模拟器——进行闭环仿真、强化学习,或者代替真机的评测,可以做到长时间的交互生成,包括在成功或失败的轨迹中进行探索。

世界模型也可以服务于策略网络,比如GigaBrain-0.5M,它是一个VLA+世界模型的混合体,通过迭代可以充分利用预训练数据和在线产生的Online Raw Data。

更进一步推出了纯世界模型的架构,彻底抛弃VLA——GigaWorld-Policy。有一个视频生成的基模来做Backbone,在训练时同时预测Action和未来的视频,在推理时只预测Action。这样既保留了视频生成的能力,又兼顾了推理效率。更进一步,在这个统一架构上还可以预测未来的Reward、奖励或惩罚信号。

算法金字塔与2028路线图

在这些模型背后,是两座金字塔。

一个是数据金字塔,分为三层,这个大家讲得比较多了,我就不再赘述了。

重点想讨论一下我们的算法金字塔。

最底层,我们希望用到一些互联网数据、包括真人的异构数据,来学习到世界的常识——比如杯子受重力影响会掉到地面上,一个塑料的杯子可能不会摔碎,但是一个玻璃杯子就会摔碎。

第二个层面,我们希望引入带Action的动作数据来进行动作的对齐,也就是进行所谓的模仿学习或者有监督学习。

最后,希望通过强化学习的后训练,来解锁预训练的能力,期望可以达到涌现的效果。

打开网易新闻 查看精彩图片

Maker H01

我们预计在今年下半年会发布GigaBrain-2,在明年上半年我们会发布GigaBrain-3,希望可以达到GPT-3的时刻。我们预期会用到100万个小时带Action的数据,用到1000万个小时视频的数据。

我们现在已经在武汉的人才公寓开始运营家庭场景的子品牌。同时我们也举办了媒体开放日、包括市民参观日,不管是媒体记者还是普通的市民,对我们现在模型所表现出来的能力都感到非常惊喜。

现在我们的机器人已经可以在家居场景下完成一些番茄炒蛋、收拾衣服、鞋子,使用洗衣机、包括微波炉这样一些工具,做一些烤面包,比较简单的家务。

我们希望在今年的Q3可以发布面向普通家庭机器人的召集计划,在Q4或者明年上半年,机器人可以进入样板家庭。经过2026年下半年、2027年一年模型能力的发展,包括电池的进步,以及本体价格的下降,我们希望在2028年机器人可以大规模地进入普通的家庭。

“2026全球数字经济大会人工智能融合应用发展论坛”由全球数字经济大会组委会主办,北京市经济和信息化局、朝阳区人民政府承办,中关村科技园区朝阳园管理委员会(北京市朝阳区科学技术和信息化局)、北京数智云科信息科技有限公司、北京信息化协会、北京人工智能产业联盟、北京数智聚联企业管理有限责任公司协办。

=▹

联系我们 CONTACT US!

请添加微信xingminghui15