大多数人都以为,想让机器人变聪明,就得不断堆参数、上大模型,最好动辄几十亿、上百亿。但面壁智能这次反其道而行——用一只仅有1.5B参数的“小钢炮”,在某些考验记忆力的操作任务上,把体量数倍于己的模型远远甩在了身后。这就是7月19日在世界人工智能大会(WAIC 2026)“智在终端 惠及千行”分论坛上正式发布的 MiniCPM-Robot 系列模型,也是面壁智能首次将触角伸进具身智能领域。
发布的产品线很清晰:两款模型,分别瞄准机器人操作和移动跟踪。通用 VLA 模型 RobotManip 负责“手”上的精细活,而 RobotTrack 专攻“脚”上的跟踪导航。两者都坚持了 MiniCPM 家族的端侧基因——小尺寸、高性能、低部署成本,而且一上来就直接开源,全部代码和权重都可以在 GitHub 和 Hugging Face 上找到。
先看负责操作的版本。它的基座是面壁智能刚推出的多模态端侧模型 MiniCPM-V 4.6,继承了该系列在视觉 Token 极致压缩上的看家本领。也就是说,摄像头拍到的画面不会全分辨率送进模型,而是被高度压缩成极少量的特征表示。
这直接带来两个好处:一是单次推理的计算量大幅缩减,二是让模型能保留长达1分钟的具身原生记忆,而额外付出的推理成本几乎跟传统单帧反应式模型持平。这1分钟的记忆有多重要?你可以想象一下:让机器人把几个不同颜色的方块盖住,再按“红-绿-蓝”的顺序一一揭开。如果模型只能处理单帧画面,它根本记不住之前已经揭开过哪些颜色,更无法按正确的顺序操作。
在考验这类上下文记忆能力的 RMBench 测试中,该操作模型拿到了53分,而当前主流模型 π0.5 只有10分,几乎等同于随机。其他主流 VLA 基准上,这款1.5B的小模型也稳居第一梯队,综合性能与 Qwen-VLA、π0.5 等更大体量的模型不相上下,部分指标甚至更优。
推理效率方面同样有看头。在包含60帧历史观测的操作任务中,传统重新计算方式每个决策步需要125 TFLOPs,而面壁的机器人模型借助流式推理仅需3.3 TFLOPs,比 π0.5 在没有任何历史帧输入时的5.0 TFLOPs 还要低。放在 H100、BF16 精度下,单决策步推理时延被压到120毫秒,比 π0.5 的234毫秒快了将近一半。换句话说,它不仅“记得”更多,反应还更快,跑起来的成本反而更低。
再来看主打移动跟踪的那款。这款0.9B参数的端到端视觉指令跟踪模型由面壁智能和南京大学合作研发,最大的卖点是:完全可以在本地断网的环境下跑,不需要云端算力,不依赖外部摄像头或激光雷达,仅凭机器狗自带的摄像头和板载芯片,就能理解文本指令并锁定目标,持续自主跟踪。
团队从单目标跟踪(STT)、动态多目标跟踪(DT)和模糊目标跟踪(AT)三个维度做了评测。在0.9B参数、仅使用监督微调且未做下游强化学习优化的情况下,三项追踪率分别达到89.8、73.4和80.4,全部刷新开源方案的最好成绩,相比 OmTrackVLA 分别提升了7.0、14.6和6.5个百分点。
就算跟某些闭源模型比,比如 TrackVLA++,在单目标跟踪和模糊目标跟踪上的追踪率也分别高出8.8和17.0个百分点,模糊目标跟踪成功率直接拉到58%。这意味着靠高质量数据和端到端训练,轻量级模型完全能在真实场景里获得足够强的指令追踪能力。
数据方面,该跟踪模型还搭了一套自进化数据管线。因为真机采集成本高、长尾场景覆盖不足是业内通病,所以这套管线先通过自动检测加人工复核清洗掉异常轨迹、错误动作等低质量样本,再引入面向具身追踪的 DAgger 策略,让模型在仿真与真机交互中主动暴露薄弱环节,针对快速转向、短时遮挡、多人交叉等复杂情形持续补充高价值数据,形成一个越用越强的闭环。
落实到真机上是什么表现?在宇树 Unitree Go2 机器狗上,团队对完整运行链路做了系统优化,模型在原生本地算力下可以稳定跑到5+ Hz,端到端响应时延约180毫秒。现场 Demo 做了一个很极端的测试:突然拔掉网卡,机器狗依然能依靠本地视觉画面和文本指令持续完成目标识别、跟踪与运动控制。这种能力可以直接迁移到楼宇巡检、人员陪护、园区安防等场景,未来在灾害救援、特种作业等弱网甚至断网的环境里也有想象空间。而且整套部署流程会与模型一同开源,提供一键启动脚本,覆盖模型加载、摄像头接入、指令输入和控制接口,真正做到开箱即用。
热门跟贴