文丨谢瑞瑞
编辑丨徐青阳
在2026世界机器人大会上,星海图创始人兼CEO高继扬发表题为《从开发者到生产力:开源开放加速具身智能落地》的主题演讲,分享了以基础模型为核心驱动力的具身智能产业化路径,以及星海图围绕模型研发、数据体系、生产场景落地和开发者生态建设的探索。
高继扬认为,具身智能正在经历从“卖机器人”到“卖生产力”的转变。随着基础模型能力快速提升,机器人产业的价值将逐渐从整机向智能能力迁移,未来商业模式也将从整机销售,走向面向具体场景的解决方案订阅,并进一步迈向以物理世界Token消耗为核心的新阶段。
在他看来,决定具身智能能否真正落地的关键,不只是机器人本体,而是背后的基础模型能力。具备零样本泛化、通用抓取和长程任务能力的具身模型,才能让机器人适应复杂生产环境。
同时,通过强化学习和大规模数据训练,机器人还需要持续提升速度、精度和泛化性,最终从实验室能力走向真实生产场景。
以下为高继扬演讲全文:
01 从卖硬件到卖生产力
今天我分享的主题是《从开发者到生产力:开源开放加速具身智能落地》。“生产力”这个关键词,其实也是星海图从创办开始一直坚持的使命。我们希望具身智能真正进入物理世界,产生实际生产力,让机器人能够解决真实问题、完成真实任务。
很早以前,我们就意识到,要实现这一目标,核心驱动力一定来自基础模型。从我们的判断来看,以基础模型作为核心驱动力的具身智能产业化,会经历几个不同阶段。
在2026年之前,模型能力还比较有限,行业里很难看到真正由模型能力驱动的商业化。过去大量机器人的销售,本质上仍然以整机销售为主,客户购买的是机器人本身。
但过去一年,我们看到基础模型能力快速发展。从2025年至今,全球已有100多款开源基础模型发布,而且几乎每隔几个月,行业都会出现新的进展。
随着模型能力提升,从今年下半年到未来几年,具身智能产业可能逐渐进入新的商业阶段。第一阶段,我们称之为“方案订阅”。客户购买的不再只是机器人本体,而是一套能够解决实际生产问题的方案,机器人只是其中的载体。
随着智能能力进一步提升,当机器人从单一场景走向多场景、多任务适配,产业商业模式还会继续变化。未来,可能会进入以“物理世界Token销售”为核心的阶段。简单来说,就是机器人在物理世界执行更多任务,基础模型能力被持续调用,智能本身成为新的价值来源。
在这个过程中,具身智能的价值量也会逐渐从整机向智能能力迁移。目前行业销售整机,毛利率大约在40%到60%。进入方案订阅阶段后,整机毛利率可能会下降至20%左右,未来甚至可能出现低毛利甚至负毛利的硬件模式。
原因很简单,我们希望更多机器人进入真实环境,形成更大规模的智能应用,而真正产生价值的是背后的模型能力。
02 机器人进入工厂,“大脑”决定上限
基于这样的判断,我们给星海图的定位是“具身大脑公司”。
过去三年,我们一直围绕基础模型进行研发。目前,我们的基础模型已经稳居全球第一梯队。事实上,我们在8个榜单上都取得了第一。
今年一季度,我们发布了Fast-WAM最新模型架构;第二季度,我们发布了G0.5模型。今年8月,在海外RoboDojo基准评测中,我们的G0.5模型再次获得行业第一。
我们据此认为,一个真正面向生产力的具身模型,需要具备三个关键能力:零样本泛化、通用抓取以及长程任务能力。
第一个能力是零样本泛化。简单来说,就是“言出法随”,即使机器人面对没有见过的新任务,也能够根据指令完成操作。比如告诉机器人“把面包从盘子里拿起来,然后放进面包机”,或者“把碗里的食材倒进锅里”,这些任务机器人此前没有训练过,但模型能够根据指令理解任务,并完成动作。
第二个能力是通用抓取。抓取是具身智能非常核心的能力。所谓通用抓取,就是机器人不需要经过针对性的后训练,也不需要人工编程,就能够处理不同大小、不同形状、不同材质的物体,并实现从任意位置抓取,再移动到目标位置。
第三个能力是长程任务。真实生产环境中的任务,很少是单一动作。一个完整流程通常包含几十个甚至上百个动作。例如生产线上的一个工作流程,可能包括识别、抓取、移动、装配、检查等多个连续步骤。模型能否稳定完成长程任务,是决定它能否真正创造商业价值的重要因素。
我们展示的叠纸盒任务,就是一个典型案例。整个过程包含上百个动作,而且需要连续完成精细操作。
03 从厘米级操作,到毫米级精度
基础模型完成预训练只是第一步,后训练同样非常重要。
目前行业主要关注监督微调(SFT)和模仿学习,但强化学习也是提升机器人能力的重要方式。我们已经完成了几十台机器人的编队式、分布式强化学习训练。
强化学习带来的一个重要变化,是让机器人从厘米级操作能力,进一步提升到毫米级,甚至亚毫米级。同时,任务成功率也能够大幅提高,目前部分任务成功率已经达到99.9%。
比如在一个多机器人协同场景中,当机器人执行任务出现问题时,人可以进行接管操作。这个过程我们称为“接管采集”,在机器学习领域也叫DAGGER。这一次人工干预过程,会形成新的训练数据,再反馈到模型训练中。
另一个案例是精密装配任务,比如机器人拿起一个螺丝,将它准确放入孔位,再使用工具完成固定。这类任务对精度要求非常高,也是传统机器人较难处理的场景。未来,基础模型能力的持续突破,本质上都来自真机强化学习。
当机器人进入真实生产场景后,我们认为,评价一个具身模型是否具备生产能力,主要看三个指标:速度、精度和泛化性。
其中,速度代表作业效率。目前机器人执行效率仍然低于人类,大约处在人类效率的70%-80%。精度方面,机器人目前可以稳定完成厘米级操作,毫米级精度则需要依靠强化学习继续提升。
第三个指标是泛化性。最简单的理解方式,就像是培训成本。人类员工进入岗位之前,需要培训;未来机器人进入岗位,也需要培训。如果一个机器人完成新任务需要大量人工调试,说明泛化能力不足,培训成本较高。如果未来机器人只需要少量数据,甚至几条数据,就能够完成新的任务适配,说明模型泛化能力正在提升。
目前,我们完成一个新的长程任务,大约需要10小时左右的后训练。未来,我们希望能够进一步降低到1小时,甚至只需要几条数据,就可以完成长程任务的后训练。
04 数据决定模型上限
要让具身智能真正形成生产力,除了模型架构,还需要解决数据问题。
过去几年,行业经历了不同的数据路线探索,包括仿真数据、真机数据,以及现在越来越受到关注的人类数据。我们的判断是,未来具身智能的数据路线最终会逐渐收敛到大规模人类数据。原因很简单,物理世界中的任务非常复杂,很难通过仿真完整还原真实环境。人类每天在不同场景中的操作,本身就是非常丰富的数据来源。
因此,未来需要积累大量第一视角的人类视频数据。
当然,单纯的视频数量并不是关键。真正重要的是,如何把原始视频转化为能够训练模型的数据。一个视频能不能用于训练,与画面是否清晰并没有直接关系。关键在于,我们是否能够从中提取出模型需要学习的信息,比如动作、环境变化、物体状态、接触关系等。
模型公司需要定义什么样的数据能够帮助机器人理解物理世界,也需要根据训练方式设计对应的数据标注体系。这实际上是一个不断迭代的过程。我们一边扩大数据规模,一边探索新的训练方法,再根据模型需要反向调整数据处理方式。
目前,几十万小时到百万小时规模的数据,已经可以支持基础模型预训练。但未来仍然需要继续扩大数据规模,同时探索更有效的学习范式。因为现在无论是VLA(视觉-语言-动作)模型、World Action Model,还是我们提出的Latent World Action Model,都还处于探索阶段。
具身智能最终需要形成自己的基础模型训练方式,但目前行业还没有完全找到最终答案。
05 让模型落地真实生产场景
基础模型的发展,最终还是要回到真实应用。今年开始,我们围绕四大方向推进具身智能落地,包括电商零售、工业制造、快递物流和商业服务。
在这次大会现场,我们也展示了与京东合作的全球首个全自主机器人前置仓。这个系统实现了从货物拣选、抓取、放置,到最后打包的完整流程。其中最困难的是打包环节。因为抓取一个固定物体相对容易,但面对柔性的包装袋,需要机器人完成打开、装入、整理、封口等连续动作。
整个过程全部由模型驱动,没有人工操作。现场一天时间,我们完成了100多单执行任务。目前系统可以支持数百个SKU(最小存货单位),并具备进一步扩展到千级、万级SKU的能力。
除了国内场景,我们也在拓展海外应用。例如美国洛杉矶的3PL仓库,机器人需要完成拣选、打包,以及退货重新上架等任务。海外市场在机器人应用方面可能会更快,因为当地劳动力成本较高,招聘和培训难度更大,对于自动化和智能化的需求更加明显。
今年,我们正在陆续交付千台级别的机器人。这里需要强调的是,我们关注的是“模型驱动的真实生产力订单”。如果单纯看整机销售,行业里有很多不同方式。但真正由模型能力推动、解决实际生产问题的订单,才代表具身智能商业化正在发生。我们希望明年能够实现数倍增长,达到万台规模。
06 扩大开发者生态
围绕下一代生产力平台,我们提出“1+3+N”的战略。其中,“1”代表一个核心方向,也就是整机加智能。具身智能一定是软硬结合的产业。机器人本体和AI模型需要共同发展,才能形成完整解决方案。
在此基础上,我们布局三个产品系列。第一个是轮臂产品系列,主要面向结构化生产场景。第二个是双足人形机器人产品系列,主要面向能源、电力等更加复杂、非结构化的环境。第三个是Lemo系列,面向创客和开发者群体。
我们希望通过更低门槛的产品,让更多开发者参与到具身智能的发展过程中。
对于轮臂产品,我们最新推出的旗舰产品强调“刚柔并济”。所谓“柔”,是指它具备较高精度的力控能力和位置控制能力。目前,它可以实现0.1N的力控精度,以及0.1毫米的位置控制精度。所谓“刚”,是指它能够承担较大的负载。单臂最大负载可以达到10公斤,双臂可以完成20公斤负载。
我们之所以能够在保持较为纤细结构的情况下,实现这样的负载能力,其中一个关键原因,是我们在双臂内部采用了三个直线执行机构,提升了整体负载能力。
同时,我们也针对工业应用需求进行了优化,包括防护等级、宽温域运行能力,以及端侧模型推理能力。目前,G系列模型可以直接运行在机器人端侧,只需要700到1000 TOPS级别算力,就能够完成实时推理。
今年6月,我们也发布了双足机器人产品Kengo行客系列。双足机器人主要面向更加复杂的非结构化场景。我们认为,轮臂机器人和双足机器人未来会承担不同任务。轮臂更适合结构化环境,而双足机器人能够进入更多复杂空间,例如能源、电力等行业场景。
Kengo系列双足机器人与NEXO轮臂产品,是我们打造的新一代动力平台。在这些产品中,核心部件包括齿轮、齿条、电机等,均由我们自主研发,并联合上游伙伴进行工艺创新。通过核心技术突破和产业链协同,我们希望进一步降低产品成本,推动具身智能规模化应用。
除了面向产业场景的机器人,我们也推出了Lemo系列,面向创客和开发者群体。我们希望通过低门槛、高性价比的产品,让更多开发者参与到具身智能的发展中,让具身智能像3D打印一样,被更多人使用和探索。
围绕这一目标,我们不仅提供硬件平台,也降低软件开发门槛。Lemo系列配套封装了G系列模型,并开放相关开发工具,帮助开发者更快完成应用开发。
今年下半年,我们还将在这一产品序列中推出更多新品。
与此同时,我们也在持续建设伙伴生态。今年6月,我们联合凯辉基金推出“星图计划”。目前,我们已经投资7家公司,并形成十几家的产业合作伙伴。未来,我们希望建立更加开放的伙伴体系。目前,我们大约有20多家合作伙伴,希望到2027年,这个数字能够超过100家。
我们希望与更多伙伴携手同行,共同推动具身智能走向规模化应用,让它真正转化为现实生产力。
特约编译金鹿对本文亦有贡献
热门跟贴