只需下达一条复杂指令
机器人就能自主拆解
并完成多项子任务
全程实拍、无遥控、无预设脚本
在陌生环境
独立完成整套作业
近日,成都人形机器人创新中心发布了全球首个复杂语言指令集全自主(无遥控)超长视野机器人任务执行系统,解决了机器人在陌生环境无法自主完成决策规划的难题,让机器人摆脱实验室的“预设摆拍”,走进复杂多变的真实场景中,相关技术已取得发明专利授权。
长久以来,大众看到的很多人形机器人演示大多局限于实验室场景。环境提前布置、动作提前编排,机器人更像完成“预设摆拍表演”。一旦放到真实多变的现实空间,面对观测不全、环境变化、物体接触突变、执行误差等现实问题,机器人极易陷入“看不懂、想不通、做不对”的困境。评判机器人智能高低,早已不再只看行走、抓取这类单点动作,更要看它面对复杂任务时推理目标、自主规划、出错后自我修复的综合能力。
分层认知体系:
厘清“做什么、怎么做、动起来”
这套自研架构核心是Agent—MCP—Skills分层认知决策体系,和世界模型深度融合,把机器人大脑拆解为任务决策、资源调度、技能执行三层,分别回答“做什么、怎么做、动起来”三大核心问题。
人形机器人智能决策与作业操作统一框架
Agent任务规划器负责读懂人类语言指令,把复杂长任务拆解成包含子目标、异常处理的任务图,并非输出死板固定动作;MCP协议充当桥梁,打通各类外部模型、知识库、仿真环境、硬件设备等各类异构资源,实现系统解耦灵活拓展;Skills技能记忆库把各类操作封装成可复用技能包,按需调用,减少重复计算负担。
成都人形机器人创新中心
世界模型则是整套系统的底层认知底座。它融合视觉、语言、触觉、本体感知多维度信息,构建场景隐状态表征,不光识别物体位置,还理解物体之间关系、接触状态与物理因果。在执行动作前,机器人会在内部推演不同动作带来的环境变化,预判风险;在执行过程中持续接收环境反馈,随时修正行动。VA、VLA、VTA、VTLA、ACT、Diffusion Policy等主流操作策略不再是孤立模型,全部通过统一接口接入架构,系统会根据现场环境、任务风险自动选择最合适的动作策略。
构建三级闭环
攻克陌生环境自主作业行业“痛点”
整套系统搭建起任务、技能、动作三个不同时间尺度的闭环。高层低频调整整体任务目标,中层按需调度技能,底层高频完成动作推理与局部校正。从接收人类指令,理解拆解任务,调取技能库,依靠世界模型预判推演,再到肢体执行,遭遇环境变化实时回退重规划,形成完整可验证、可回退的全链路。
这解决了行业“痛点”:面对从未适配过的陌生场景,机器人无需提前录入场景数据,就可以做到零样本条件下自主决策规划。
硬件运动能力决定机器人能不能动,而大脑决策能力决定机器人能不能真正干活。人形机器人大脑的核心问题,不是简单把大语言模型、视觉模型和运动控制串接在一起,而是要搭建任务语义、世界状态、技能先验和动作策略之间可计算、可验证、可回退的层级映射关系。核心价值不在于堆叠了多少模型,而在于建立了从任务理解到技能选择再到动作执行的完整闭环——解决真实世界中(非实验室环境),机器人没有经过相关场景的数据适配就无法自主完成任务决策规划(零样本泛化)的难题,让机器人真正具备了在陌生环境中自主完成长时序任务的能力。
6月16日,中国电建供应链合作发展大会在雄安新区顺利举办。会上,成都人形机器人创新中心联合中国电建成都院、大型央企、智成睿锦机器人科技(成都)有限公司,共同签署5000台具身智能机器人产品战略采购协议。
随着技术迭代,人形机器人正逐步走出实验室展厅。该架构为人形机器人落地工厂、家庭等真实场景提供系统化技术路径。未来,人形机器人不再只是用来展示的展品,有望成为能自主应对复杂现实环境、处理多样化任务的实用智能助手。
记者:刘倩婷
视 频 制作:汪诺珊
编辑:张胤、朱孟玖
热门跟贴