过去两年,具身智能行业掀起了一场激烈的“硬件军备竞赛”:能后空翻的人形机器人、刷新奔跑速度纪录的机械腿,以及在精密设定下倒水、叠衣服的机械臂层出不穷。但在这些炫酷展示的背后,一个极其现实的问题摆在了所有从业者面前:具身智能到底该怎么赚钱?
目前,行业的主流玩法依然是“卖机器”:将昂贵的硬件本体搭配针对特定场景写死的工作流软件卖给 B 端客户。但硬件制造天然受制于供应链和规模效应,毛利率在残酷的价格战下不可避免地会走向极度微薄。如果具身智能真的是继智能手机之后的下一代计算平台,它的商业终局,绝不可能仅仅是一家“硬件设备制造商”。
在正在进行的 2026 世界机器人大会(WRC)上,星海图联合创始人高继扬指出,具身智能的商业模式最终将彻底颠覆,走向以“物理世界 Token”的销售为主体。他认为,在未来的终局里,机器人硬件(整机)甚至可能沦为“负毛利”的载体,其唯一目的就是把更多的终端铺到真实世界中去。而产业真正的价值核心,将 100% 向“具身大脑”迁移。
就像今天的 OpenAI 按大语言模型吐出的“文本 Token”向开发者收费一样,未来的具身智能巨头,将按照机器人在物理世界中执行的每一个有效动作、完成的每一次任务,即“物理世界 Token”,来攫取难以估量的商业红利。
当然,要支撑起如此庞大的“Token 经济”,底层大脑必须跨越一道天堑。作为一家坚定的“具身大脑”公司,星海图在底层模型上给出了自己的解法:用统一自回归架构打通零样本泛化、通用抓取和长程任务。在演讲中,高继扬不仅分享了上述领域的底层突破,还对“泛化性”这一学术词汇给出了极其精准、通俗易懂的商业化转译:“泛化性本质上就是培训成本”。
以下是高继扬在 WRC 2026 上的演讲实录,雷峰网在不改变原意的前提下进行了精编与整理:
商业模式三阶段:从卖整机到卖 Token
随着机器人的智能通用性不断取得进展——从单一场景有用,跨越到多场景跨任务有用,具身智能产业的核心商业模式将会发生一次根本性的变化:最终将演变为以“物理世界 Token 销售”为主体的模式。
在这个整体进程中,我们看到具身智能包含两方面:一方面是整机(硬件),另一方面是智能(大脑)。整体的价值量会从整机逐渐向智能迁移。去年和今年,我们看到行业里(包括我们自己)销售整机产品,毛利率大概在 40% 到 60%。我们相信,到了第二阶段,也就是“方案订阅”阶段,整机的毛利率可能会降到 20% 左右。
而到了真正“Token 销售”的第三阶段,整机甚至有可能变成一个负毛利的状态。因为那个时候,我们要的是让更多的终端出现在物理世界当中,去消耗更多具身智能基础模型的 Token。这是一个完全由模型能力牵引的具身智能产业化过程。
正是带着这样的认知,星海图将自己的核心定位明确为一家“具身大脑公司”。过去几年,我们的基础模型在不断迭代,不仅发布了 G0.5 模型,还推出了 fast-wam 最新的模型架构,持续在底层能力上寻求突破。
统一自回归架构:三大核心能力
如何去描述我们当前的具身大模型能力?我们可以用一句话概括:创新地采用了统一自回归架构,用单一模型贯通了零样本泛化、通用抓取和长程任务的能力。
第一个关键词是“零样本泛化”。通俗一点说就是“言出法随”。我给模型下达一句指令,它就能跟随完成。比如,对它说“把面包从盘子里拿起来放到面包机里”,或者“把碗里的食材倒进锅里”。在这些场景中,模型其实是第一次看到这些物品和环境,但依然能完成任务,这就是零样本泛化能力。
第二个关键词是“通用抓取”。抓取是具身智能非常基础且重要的能力。所谓的“通用”,就是不经过任何的后训练(Post-training)和再编程,机器人就能够把大的、小的、胖的、瘦的、不同材质的物体,从任意地方放置到另一个地方。
第三个是“长程任务能力”。为什么长程任务如此重要?因为在真实的物理世界中,几乎没有一个工作流(Workflow)是靠单一或少数几个动作就能完成的。它们基本上都是由几十个、甚至上百个动作串联而成。如何让模型连续完成上百个动作?我们通过叠纸盒等复杂精细操作验证了这种能力。这是基础模型走向真实商业价值的核心所在。
当然,仅靠强大的基础模型预训练还不够,我们还需要后训练。在后训练中,除了基于模仿学习的 SFT(监督微调)外,还有一个非常重要的技术就是强化学习(RL)。目前,我们已经完成了几十台机器分布式的编队强化学习规模化训练。这带来的效果是突破性的:我们可以把通过预训练完成的“厘米级”
热门跟贴