打开网易新闻 查看精彩图片

新智元报道

打开网易新闻 查看精彩图片

过去一年,具身智能赛道正经历着前所未有的「冰火两重天」。

一方面,一级市场热钱持续涌入,单笔融资金额屡创新高。

但另一方面,也有企业陆续启动 IPO 进程、寻求二级市场融资。

而放眼全球,具身智能行业的头部玩家们,早已敏锐捕捉到风向的转变。

特斯拉、Figure这些公司在做什么?他们几乎不约而同地把竞争推向了另一个层面——Physical AI。

特斯拉直接将自动驾驶FSD的底层架构复用至Optimus机器人,试图通过「端到端」神经网络,实现从视觉输入到动作控制的映射,如今已经在工厂执行电池分拣。

打开网易新闻 查看精彩图片

Figure AI则通过深度绑定OpenAI,将顶尖VLM注入钢铁躯壳,让Figure 01/02机器人具备自主推理、语义理解能力,进驻宝马的汽车生产线。

他们的Helix VLA模型,走的是快慢脑双系统架构,目标不是卖机器人,是卖劳动力。

这些企业路径不同,但都指向同一个判断:机器人未来的核心,是AI能不能通过这副身体理解现实世界、适应现实世界,并最终改变现实世界。

这种现象的逻辑,其实都藏在资本的周期里。大多数私募基金的投资年限是「3+2」模式(三年投资,两年退出),如今已经到了GPLP们迫切需要变现的节点。

资本的倒逼,让行业面临一个现实的分水岭:过去那个靠电机扭矩有多大、后空翻有多稳来证明「机器能动」的故事,已经讲到头了。

企业必须讲出下一个更宏大也更切实的故事——「机器能干活」。

如果只是在一个无干扰台面上,按部就班地执行机械化工作,根本用不着大模型

具身智能真正的未来,是走向AGI,是在开放、未知、充满长尾变数的真实世界中执行高度泛化的任务。

而开启这个时代的钥匙——是具备系统提升机器人工作能力的技术体系。

为什么走向AGI

必须是「体系化跃迁」?

什么是真正的体系?

近期行业内有一次动作极具代表性。

高德正式宣布其全栈具身技术体系ABot 完成升级,一次性发布了五款新模型(N1、M0.5、ER、AgentOS、C0),并在17项权威基准中拿下SOTA。

打开网易新闻 查看精彩图片

它提供了一个极佳的产业切片,向外界展示了全球首个全栈具身技术体系是如何将世界模型、基座模型与具身Agent架构耦合为一个「有机生命体」,并实现落地的。

ABot最早发布于今年4月,彼时高德自研的机器导盲犬高德途途首次登上机器人半马的舞台,并展示了其出色的开放环境全自主导航能力。

途途背后的技术支撑就是高德ABot全栈具身技术体系。相比于单个模型能力研究,高德从一开始就搭建了一个为机器人实现高阶智能的底层平台。

其中的每一款模型都有其对应的功能和角色。这是一个具备完整分工且能「自己长本事」的闭环飞轮。

打开网易新闻 查看精彩图片

在开放环境中,任意一个通用任务,都需要机器人同时调配多个能力进行编排和协同,最后落地执行。

以最常见的家庭场景为例,RoboCasa-365等权威基准需要将日常任务拆解为数百个涉及语义理解、长程规划和位移操作的任务,然后进行对应的能力评估。本质是因为,想在家庭场景完成作业,单一的手或者脚足够灵活,还远不足以支撑。

用户需要的是完整的智能,而非只具备手臂或者下肢局部能力的「瘸腿」智能。

而ABot这类架构,正是针对这个痛点而打造。

打开网易新闻 查看精彩图片

三层架构,一个飞轮

高德ABot体系的核心,是一个精密咬合、可自进化的三层结构。

最上层是「具身大脑」,由通用具身大脑ER和机器人Agent操作系统AgentOS构成,负责环境感知、任务推理、高层决策调度与记忆沉淀。

中间层是「运动双核」,由N1和M0.5组成,分工管「脚怎么走」和「手怎么干」。

最底层是「训练与仿真环境」,以世界模型ABot-World和3D世界模型ABot-Earth持续提供仿真和训练。

这三层架构决定了ABot的每一次迭代,都不是孤立地点亮某个新技能,而是像生物进化一样,随着任务和部署的增多进行整体演进。

这样的进化能力更类似于人类成长的节奏,在一个人中学阶段学习的是一元二次方程,大学阶段掌握的则是微积分。每一步的成长,都是完整且高度统一的。

而在这套架构之外,高德途途和它自带的ABot-C0则扮演端到端能力验证的外化本体。让ABot每一个能力的提升都能在本体上有完整呈现。

为什么一定要做这么完整的架构?

因为只有体系跑起来,仿真训练、物理交互与记忆调度才能彼此反哺。

在单点研究的机构里,研究大脑的和死磕灵巧手的彼此割裂。

但在完整的体系内,手和脚的能力,能够被一体调用;它们沉淀的知识和经验,会反向转化为记忆回馈给大脑,大脑再将记忆用于模型的专项训练,从而训练更好的模型和更聪明大脑。

打开网易新闻 查看精彩图片

飞轮每转一圈,整体智能水平就抬高一层。 手和脚的能力提升是同步的——脚走得好,手也不会差。整个系统是一个内循环,逐步向AGI靠近。

从高德此次全新发布的五款模型背后,我们能够完整看到这套体系究竟是如何应用于机器人,并实现它们质变升级的。

这五款模型类似于高德为机器人打造的「数字灵魂」,它们完整地映射在机器人的五大仿生单元。

双脚(ABot-N1):通用导航基座模型,负责空间感知与移动。

双手(ABot-M0.5):通用操作基座模型,负责精细化物理交互。

大脑(ABot-ER):具身大脑,负责统一的逻辑推理与环境认知。

中枢(ABot-AgentOS):执行中枢,负责记忆调度与任务下发。

运动神经(ABot-C0):运控系统,将ABot体系的决策稳稳传导至机器人的躯体动作上。

体系化带来的三大「表征」

当这五大「数字灵魂」在三层架构的驱动下精密咬合、协同运转时,便不再是冷冰冰的代码与模型,而是化身为对复杂物理世界有强大适应力的物理智能体。

这种从底层架构向物理世界的全面映射,超越了传统单点突破的机器人研发模式,并最终外化为传统机器人整体性的物理表征。

表征一:「身随眼动」

相比于让机器人实现一些高难度的动作,高德的ABot-N1更聚焦于让机器人合规安全的走进人类生活当中。

打开网易新闻 查看精彩图片

ABot-N1在R2R-CE等5项权威基准取得SOTA

让机器人真正走向开放世界,最大的拦路虎就是机器人无法直接使用常规的导航地图。常规导航用于人类出行,地图精度有限。

但是由于人类具备空间常识和安全意识,即便出现地图偏差和定位漂移,也不影响正常使用,而机器人如果进入开放环境遇到这种问题,将对安全性造成巨大风险。

高德的解法是,为N1导航基座设计了「快慢双系统」架构。慢思考负责长程路线规划,快思考负责实时控制。

打开网易新闻 查看精彩图片

ABot-N1开放环境全自主导航克服定位偏差

一旦判定导航路径或定位有误差,「慢系统」会立刻通过本体系下的视觉感知,让机器人靠像素-语言双思维链来实时行驶在合规路面。

在实际导航任务中,快慢双系统异步协同,让机器人在仅有低精度SD地图时,既能准确抵达指定坐标目标,又能沿人行道、斑马线安全通行,而不是像纯度量式策略那样为了到点而抄近道横穿车道、踩踏绿化带。

更关键的是,N1首创了「Think-and-Point」,不仅消除了部署黑箱,还让机器人在每一次自主导航中收集交互数据,并结合空间几何知识,在ABot体系中内化出属于自己的「空间直觉」。

依靠这种直觉,它在开放环境自主导航任务中创下92.9%的成功率,做到了城市级的长程自主导航。

值得一提的是,ABot-N系列工作已经入选了CVPR年度最佳论文的候选。在此基础上,ABot-N1不仅延续了一套权重对出行导航全场景任务集的完整覆盖,还在R2R-CE等5项权威基准均刷新了SOTA。

表征二:「手脚并用」

一个合格的具身智能体不仅要能「走出去」,还要能「能干活」,移动操作是通用机器人迈向真实物理世界的关键能力。

在真实的移动操作任务中,传统机器人往往是单线程结构,左手、右手、底盘线性串联,如果一步卡住就会直接死机。

体系化的最大亮点之一,就在于「解耦」。

ABot-M0.5将运动与操作拆分为互不干扰的双动作流,并引入「帧级隐式动作」,让机器人在极细的时间颗粒度上实现眼、手、脚的实时对齐。

打开网易新闻 查看精彩图片

ABot-M0.5全自主进行移动操作

这既解决了单一动作空间中移动与操作相互干扰的问题,还保证了模型能捕捉一些微观且高频的物理交互,从而保证任务的执行质量。

面对训练和推理环境不同,造成的长程任务执行过程中的误差累积问题,ABot-M0.5通过ABot体系激活了「数据回流」机制进行了解决。

ABot-M0.5具备独特的「梦境自愈(Dream-Forcing)」能力,这个机制强迫模型在预测的含噪画面中继续生成动作,避免细小偏差导致任务失败。

这些数据源自模型自造,它们会通过ABot的数据回流机制,沉淀为整体记忆和共享经验,持续强化模型训练。数据显示,ABot-M0.5在RoboCasa-365复杂任务测试中大幅领先前代SOTA达20.4%。

打开网易新闻 查看精彩图片

ABot-M0.5在LIBERO、Robo-Twin等4项权威基准中均取得SOTA

表征三:「过目不忘」

在具备了优秀的四肢能力后,机器人在真实且复杂环境中,还需要一个完整的机器人操作系统,来统一进行决策和能力调配。

依靠顶层的ABot-ER与AgentOS,机器人拥有了从「想明白」到「做得到」的完整闭环,以及终身记忆的能力。

其中,ABot-ER是面向真实环境的通用具身大脑,统一支撑机器人从感知到决策全流程。它让机器人不只是识别画面中的物体,而是能够「想明白」物体、空间与任务之间的关系,并做出合理判断。

打开网易新闻 查看精彩图片

ABot-ER取得3项SOTA,并登顶数十家机构联合发布的Embodied Arena 2D-EQA

AgentOS则将规划与执行从本体中解耦,通过插件式Skill接入,让同一套系统能适配各种异构机器人。

同时,它自带跨任务、跨时间的多模态记忆,能在失败中定向优化记忆存储,并将沉淀的数据转化为整个ABot体系的共享资产。

打开网易新闻 查看精彩图片

ABot-AgentOS多模态终身记忆 过目不忘

凭借系统级的经验反哺,机器人真正能够跨本体和跨任务做到举一反三、过目不忘。

打开网易新闻 查看精彩图片

ABot-AgentOS在Locomo等五大权威基准上均取得SOTA

所有的物理表征,都将在具身机器人进行能力外化的呈现,这个部分高德选择了其自研的高德途途和运控系统ABot-C0。这也是支持机器人行动的运动神经。该模型通过构建四足机器人统一的行为基座,实现了ABot能力的端到端验证。

打开网易新闻 查看精彩图片

ABot体系支持异构机器人协作

以上这三大表征绝非孤立技能,而是ABot三层架构「飞轮」高速运转的必然结果。

它们完美印证了这套体系的进化逻辑:手、脚与大脑在真实物理交互中获取经验,在仿真环境里持续训练,最后通过统一的记忆调度完成闭环反哺。

高德途途在现实世界中的端到端成功外化,正是最强有力的证明。

ABot不是在机械地堆砌机器人功能,而是在按照生命的进化节奏,孕育一个能自主生长、不断逼近AGI的完整物理智能体。

把二十年时空数据

变成具身智能的基座

一个做地图导航的公司,为什么能杀入具身智能的核心圈?

如果把「体系化」的三道门槛拆开,答案很明显。

数据端,相比纯模型驱动的厂商在实验室里死磕合成数据,高德背后是积累了二十年的庞大时空基座。

机器人本质上是物理空间的Agent,高德对空间的理解、环境的拓扑结构、语义信息的丰富维度,是其他厂商难以企及的天然养料。

在架构端,高德从一开始切入具身智能,就不是为了造某一台特定的机器人。它的ABot是一套完整的、解耦的全栈架构,各司其职,又通过总线互通。

这意味着,今天在四足狗上验证的经验,明天可以直接迁移到双足人形上,而不需要推倒重来。

工程化上, 从扫街榜再到具身智能,高德在转型空间智能公司的过程中,积累了极度深厚的AI工程化经验。

场景端,无论是高德途途的场景验证,还是城市级长程任务导航的实际案例,高德的体系是在真实泥泞的路上跑出来的。

把这些维度串起来,会看到一个完整的增强回路。

四者彼此咬合,才能构成一个「越跑越强」的体系——而这,恰恰是单点突破玩家很难复制的。

打开网易新闻 查看精彩图片

中场战事,刚刚拉开帷幕

回到开篇的问题:为什么具身智能的下半场,从体系开始?

因为物理世界从不按实验室的套路出牌。用单点参数的领先去击穿物理世界的复杂性,本身就存在风险。

放眼当前的具身智能赛道,行业共识正在发生剧变。

资本催熟的「纯硬件故事」已经讲完,全球最聪明的头脑都在向同一个方向聚焦:单打独斗的时代结束了,体系化作战才是破局的关键。

高德ABot架构的诞生,正是在这一行业叙事下应运而生,它与全球顶尖玩家的探索不谋而合。

它向外界证明了,可以不用再去迷信孤立的「超级大脑」或单个「灵巧手」,而是回归生命进化的本质,去构建一个精密咬合的闭环生态,才是打破莫拉维克悖论的最佳解法。

通往AGI之路上,比拼的不再是谁的长板更长,而是谁的系统能转得更稳、迭代得更快。

谁能率先构建出靠「闭环飞轮」自我进化的生态体系,让机器人在物理交互不断升级,谁就真正拿到了具身智能下半场的入场券。

泡沫退去,真正的洗牌,才刚刚开始。