打开网易新闻 查看精彩图片

打开网易新闻 查看精彩图片

2026年1月27日,人形机器人头部企业Figure实现Helix 02在Figure 03平台上自主任务演示,通过单一神经系统完成厨房空间内洗碗机全流程装卸任务,全程约四分钟。Helix 02采用“系统2—系统1—系统0”三层结构,实现视觉语言行动模型与高频全身控制的深度耦合,其技术架构与我国提出的“打造大脑、小脑、肢体”的技术路线高度契合,标志着人形机器人已从“炫技短视频”迈向可工程化的长时程任务自治。对我国而言,应将其视作统一控制架构与具身数据工程的重要参考,加快布局基础控制模型、VLA软件栈与整机平台协同演进,助力我国在具身智能国际竞争中抢占发展主动权。

三点核心技术突破

打开网易新闻 查看精彩图片

Helix 02首次完成四分钟厨房场景全身自治演示。据Figure官网及多家科技媒体报道,2026年1月27日发布的Helix 02在 Figure 03人形机器人上,完成“走到洗碗机—开门—卸载碗碟—横穿厨房—将物品放入橱柜—重新装载—投放洗涤块—启动并关门”的完整流程,连续运行约四分钟,含61个具有前后关联的移动与操作动作,全程不重置、无人工干预。Figure将其定义为首次在类人平台上实现“从像素到全身”的长时程端到端控制演示,强调过程中在手持易碎餐具时保持稳定行走、在双手占用情况下用髋部关抽屉、用脚抬门等“全身作为工具”的行为,该能力与当前主流人形机器人多为短时、脚本化动作演示形成明显区分。

Helix 02通过三层神经系统实现大脑与小脑功能分工。据企业官方文档,Helix 02在原有System 1与System 2基础上新增System 0,构建“语义推理—视觉运动—高频平衡”三层架构。其中,System 2面向秒级时间尺度,承担场景理解、语言解析及行为序列规划任务,可将单一指令扩展为长链条语义目标,无需规划具体步态与四肢协同;System 1为视觉运动策略网络,System 0直接输出关节力矩指令。该分层控制架构,在工程层面与我国提出的打造基于大模型的人形机器人“大脑”、开发控制运动的 “小脑”、构建仿真训练环境的技术路线高度契合。

Figure 03硬件平台为Helix 02提供触觉与近距视觉支撑。Figure 03是第三代人形平台,高度约1.68米、重量约60公斤,配备五指柔性手、嵌入式指尖触觉和掌心摄像头,面向家庭和工业混合场景设计,提升人机环境兼容性。在Helix 02演示中,掌心摄像头破解手臂遮挡的视觉“死角”问题,指尖传感器可感知约3克量级的力变化,支撑机器人在视觉受限情况下通过触觉精细调整抓握姿态。基于该硬件基础,Helix 02自主完成拧瓶盖、药盒取单粒药片、精准推出5毫升注射液、杂乱金属件堆中单件取物等四类典型灵巧操作,全部无远程遥控操作。这表明Figure依托“触觉+近距视觉+多指手”组合,已初步实现从毫米级指尖动作到房间级行走、跨四个数量级的统一控制。

三点研判

打开网易新闻 查看精彩图片

长时程移动操作正从“展示难点”转向“可工程化能力”。传统人形机器人将行走与操作拆分为两个独立控制模块,通过状态机在“走—停—抓—再走”之间切换,存在系统脆弱、衔接迟缓且动作生硬等问题。Helix 02依托统一神经网络,同步处理行走、抓取与平衡约束,4分钟内完成61个顺序依赖动作,为长时程家务任务的工程化落地提供了示范。相较于Google DeepMind旗下发布的Gemini Robotics本地VLA模型依托少量演示适配多平台的技术路径,Helix 02更聚焦单一平台,通过高频运动先验与触觉感知,实现长链条任务的连续无断点执行。可见,全球具身智能的竞争焦点,已从实现单一动作完成,转向在真实环境中保障长时程任务的连续性与状态记忆能力。

美国在“VLA 加人形平台”路线上的先发优势持续扩大。Figure 以Helix 02为代表,将视觉语言行动一体化模型与Figure 03硬件深度绑定;Tesla则在Optimus项目上持续落地垃圾投放、吸尘等家务场景,并在2026年一季度财报中宣布,将于2026年底在弗里蒙特工厂建成首条Optimus产线,目标年产百万级机器人规模。工业领域,Agility Robotics的Digit已在电商仓储场景完成超10万次托盘搬运,验证了长周期混合人机工位应用的安全性与经济性。结合Figure 02在宝马斯帕坦堡工厂11个月的部署实践,累计装配9万余件零部件、助力3万余台X3整车生产的落地成果,可见美国已在“统一软件栈+少数标准化人形平台+真实工业与家庭场景数据”路径上,形成从实验室技术到量产的完整产业链条。Helix 02的发布,将其技术优势从单机演示推向长时程家庭任务落地阶段,或将进一步巩固美国在高价值具身数据和运动控制基础模型领域的领先地位。

我国在人形机器人数量和场景探索上具有优势,但在具身数据与基础控制模型上仍存在短板。据2025世界机器人大会公开信息和多份产业报告统计,我国人形机器人整机企业数量和展出机型位居全球前列,涵盖特种、制造、教育和服务等多个领域,宇树、智元等头部企业已明确2026年实现批量交付。但从当前公开演示看,国内多数人形机器人仍以分模块控制、脚本化任务为主,长时程“移动+操作一体化”演示较为匮乏;具身数据采集多集中在单机示范与限制场景,尚未形成类似Helix 02所依托的 “千小时级人类运动数据+高频运动基础模型”体系。触觉与近距视觉领域,尽管部分企业已推出带触觉手套、柔性手爪、掌心相机方案,但与Figure 03从传感器设计阶段就面向VLA训练搭建的数据闭环相比,仍有一定差距。

对策建议

打开网易新闻 查看精彩图片

(一)加快构建人形机器人基础控制模型与具身数据核心能力

一是布局若干“人形机器人基础控制模型”重大专项,依托龙头企业、重点高校和科研机构,建设类似System 0的高频全身运动基础模型,聚焦关节级人类运动数据的平衡、姿态与接触控制,以统一模型替代碎片化控制算法库,打造可跨整机迁移的“统一小脑”。二是依托具身智能训练场等平台,建设多模态具身数据基础设施,重点采集工业产线、家庭服务、医疗康复等场景的人类动作、力反馈和语音指令数据,构建覆盖不同身高、体型和作业习惯的大规模数据集,明确数据采集、脱敏和共享规则。三是推动与汽车、家电、物流等头部企业联合,在真实场景中布置具身数据采集试验线,用“人机混合作业+数字孪生仿真”模式,缩短数据采集到模型迭代的周期。

(二)统筹推进VLA软件栈与人形整机平台的协同演进

一是围绕“视觉语言行动模型+人形整机”系统性路线,明确若干参考架构,将“大模型大脑、运动小脑、整机肢体”作为整体工程对象,鼓励形成开放接口标准,避免软件栈与整机平台高度绑定导致生态割裂。二是遴选在伺服驱动、减速器、本体结构和安全冗余方面具有基础的整机企业,联合云厂商和模型公司,构建面向工业与家庭双场景的开放VLA软件栈,通过统一的感知、决策、控制接口支持多型号机器人接入,形成“软硬解耦、模型共享”的产业生态。三是支持在工业强省和部分重点省份建设人形机器人开源社区和测试平台,鼓励围绕路径规划、触觉融合、误差恢复等关键子问题形成开源算法和工程组件,助力更多企业在统一软件栈之上开展差异化创新。

(三)以场景示范与安全治理双轮驱动引导产业有序发展

一是由牵头部门统筹,会同各相关部门,围绕汽车总装、电商仓储、3C装配、养老护理等领域,布局一批“长时程任务示范工程”,明确各示范项目的连续运行时间、任务复杂度和安全指标。二是推进人形机器人安全标准和监管规则建设,重点围绕人机协作距离、力量限制、跌倒与碰撞处理、远程更新与故障恢复等环节制定强制性标准,探索引入第三方安全评估与认证机制。三是依托现有机器人和新能源汽车产业集群,建设人形机器人创新发展试点区,引导企业聚焦可落地高价值场景,形成“基础模型—整机平台—场景应用—安全治理”闭环。

来源 | 赛迪智库

编辑 | 办公室

打开网易新闻 查看精彩图片