IT时代网6月22日消息,具身智能的"GPT时刻"什么时候到来?3年、5年还是更久?近日在星海图全球开发者大会上,星海图CEO高继扬抛出了一个独特观点——这个时刻可能不会像大语言模型那样明显。

打开网易新闻 查看精彩图片

高继扬认为,大语言模型是每个人在手机上就能感受到的东西,而具身智能可能在一个地方落地了大家都不知道。具身智能的落地过程是随着能力边界逐个场景解锁的。"可能若干年之后,我们回头一看,原来机器人已经无处不在,但我们已经记不得是从哪一年开始。"

6月16日,星海图发布新一代VLA基础模型G0.5并宣布开源,同时公布世界模型Fast-WAM与全身控制基础模型,自研双足人形机器人Kengo(行客)现场首秀。高继扬在会上分享了关于VLA与世界模型路线、数据成本、整机与智能投入平衡等核心问题的思考。

打开网易新闻 查看精彩图片

关于VLA与世界模型的路线之争,高继扬明确表示二者并非对立,而是同源共生。训练VLA和WIM的底层逻辑相同,都是将多模态数据变为Token、通过多层Transformer处理,区别仅在于监督方式和架构调整。所有数据——human centric data(UMI、Ego等)与robot centric data(遥操作数据)——均可混用。

打开网易新闻 查看精彩图片

在数据成本方面,高继扬提出应关注智能总成本而非单项数据成本。数据成本与算力成本之比至少为1:10,即1块钱的数据需要10块钱的算力来训练。目前human centric data采集成本约50-100元/小时,robot centric data约250元/小时,相比大语言模型每年数亿美金的算力支出,数据采集投入极为划算。

对于整机和智能的战略关系,高继扬用"有限游戏与无限游戏"来概括——整机和供应链是有限游戏,智能和应用才是无限游戏。如果不玩好有限游戏,就没机会玩无限游戏。从研发投入看,智能投入远超整机,存在数量级差距。

关于市场竞争,高继扬表示现阶段不追求整机销售的绝对第一,因为这个阶段的第一没有意义。真正的商业化将在智能驱动的生产力场景展开,届时商业模式将是方案订阅制。在他看来,当前展演艺市场虽已有十亿级营收企业,但生产力场景尚未有任何企业真正有效作业,"真正的星辰大海还没有展开"。

创作声明:本文借助AI辅助创作