南方财经记者谭砚文
“把桌上的杯子拿起来。”对人而言,这是一条无需过多思考的指令。但对机器人来说,识别出杯子只是开始:杯子位于什么位置、距离机器人多远、机械臂应该抓住杯柄的哪个点位,都需要被转化为可执行的三维坐标。
这正是机器人从数字世界走向物理世界时面临的一个断层。现有的视觉语言模型(VLM)回答“眼前有什么”,却未必能告诉机器人“应该在哪里行动”。
这正是空间智能模型SpatialPoint试图解决的问题。SpatialPoint由视启未来(深圳)科技有限公司(以下简称“视启未来”)联合清华大学、粤港澳大湾区数字经济研究院(以下简称“IDEA研究院”)共同研发,通过融合RGB图像、深度信息、自然语言三类数据协同推理,将AI的能力从“理解世界”推进到了“确定行动位置”。
这也是空间智能真正迈向具身智能的关键一步。在具身智能加速走向产业化的当下,SpatialPoint的价值,不只是让机器人的视觉识别更精准,更重要的是让视觉语言模型与机器人执行系统实现直接打通,使模型输出结果成为机器人可理解执行的操作指令,让机器人走向产线、创造价值。
对于具身智能而言,识别目标只是第一步,空间定位才是行动的前提。
VLM已经能够识别物体、理解指令,但仍存在“看得见物体,却无法判断其三维空间真实位置”“能识别出物体,却无法确定具体行动点位”等问题。更重要的是,各类任务存在“模型孤岛”,机器人身处连续统一的三维物理世界,但其AI系统却将完整的空间交互任务拆分成多个互不连通的独立模块。
基于此,SpatialPoint试图搭建一套通用、统一的空间交互接口,成为机器人的“算法大脑提供者”。
IDEA研究院讲席科学家、微软研究院前高级研究主管、视启未来创始人张磊向南方财经记者表示,团队将机器人所需的空间信息统一抽象为两类核心点位:第一类是实点(Touchable Point),附着于物体表面,对应抓取杯柄、按压按钮、转动门把手等需要直接接触的位置;第二类是虚点(Air Point),位于周边自由空间,对应物体放置、机器人导航以及安全避让等位置。
“SpatialPoint的核心突破,是让机器人依托视觉感知与自然语言指令,动态理解作业空间、自主判断行动方式,以适配复杂多变的场景需求。”张磊介绍,SpatialPoint有四项核心创新:一是在传统VLM的RGB图像视觉输入的基础上,增设专属的深度编码网络;二是将RGB、深度与语言纳入统一序列,协同完成空间判断;三是直接输出可供机器人调用的三维坐标;四是把抓取、放置、导航统一为实点与虚点两类任务,形成通用空间行动接口。
以“把餐桌上的水杯拿起来,放到客厅茶几中央,再走到玄关鞋柜旁边待命”为例,这条指令包含抓取、放置和导航三项任务。传统机器人方案需要依靠多个独立模块协同完成整套流程。视觉模型先从RGB图像中识别水杯,抓取模块再确定操作位置,系统结合深度传感器和坐标转换生成机械臂可执行的三维坐标;完成抓取后,还要调用放置模块定位茶几中心,最后由导航和避障系统规划机器人前往玄关。
SpatialPoint则将RGB图像、深度信息和语言指令纳入同一套空间推理过程:通过RGB图像完成场景识别;再依托深度信息构建真实三维空间关系,精准判断物体距离、目标点位与可通行空间;最后,结合语言指令解析对应的空间操作逻辑,匹配抓取点、放置点和导航点。整套流程最终可直接输出相机坐标系下的结构化三维坐标,将从语言指令、场景理解、空间推理、三维定位到机器人执行的全链路,统一整合至单一模型接口中。
从实测数据看,SpatialPoint最核心的优势是定位精度大幅提升。在需要机器人实体接触的实点任务中,有效操作位置准确率达79%,三维距离预测平均误差仅17.2毫米,有效操作区域内误差可降至9.3毫米。较传统纯RGB方案,精度提升超30倍。在放置、导航这类自由空间定位的虚点任务中,模型训练3轮后,正确方向识别概率达50.71%,5厘米范围内定位成功率为33.47%,方向、距离双达标联合成功率16.41%,距离预测平均误差降至6.8厘米。
“SpatialPoint不只是一款全新的VLM,更是对机器人信息处理范式的创新探索。”张磊表示,长远来看,SpatialPoint不仅适配当下的具身智能任务,也在探索为世界模型和物理智能提供统一的空间交互接口,让AI进一步理解物理世界中的位置、距离和空间关系,推动机器人从认知世界走向与世界交互。
机械臂。受访者供图。
机器人产业化下一阶段的关键,在于提升适应复杂环境的能力。
当前工业机器人产业已形成较成熟的设备体系,但不少机器人仍依赖固定位置、固定物料和固定动作。在标准化量产中,这种方式效率较高。但是,面对SKU更替、物料位移和任务调整,企业却常常需要重新编程和调试,设备柔性不足。
SpatialPoint提供了一种解法:让机器人根据视觉感知和自然语言指令动态理解作业空间,自主判断下一步应该在哪里行动。对制造企业而言,其价值不只是看得更准,还在于减少生产变化带来的重新配置成本,推动机器人从执行预案走向理解现场。
“无论合作方使用机械臂、移动机器人还是人形机器人,只要搭载RGB-D等空间感知传感器,团队的上层空间智能模块就可以提供场景识别、指令理解和空间行动定位能力,形成‘算法大脑+机器人硬件本体’的协同模式。”张磊表示。
制造企业是最核心的落地载体。在工业制造中,SpatialPoint可以适配柔性抓取、精准放置、移动避障和人机协作等任务:机器人根据工件的实际形态寻找抓取位置,理解各类指令,并判断可用区域和目标点;在物流运输和人机协作中,系统还需要持续感知人、设备和物料的空间位置变化。
目前,SpatialPoint已完成多场景真实机器人部署验证,并与多个产业团队开展视觉智能、机器人技术及产业应用的深度探索。
但是,从实验室到真实场景仍有距离。张磊表示,要进入真实产业,首先需要强化落地实时性与可靠性,具备异常识别、噪声适配、风险预判和安全运行能力;其次,需要实现多设备通用适配,需优化技术架构,输出与机器人本体解耦的通用空间表达能力,打造一套模型,适配全品类机器人设备。
这些能力的验证,离不开真实的产业场景。粤港澳大湾区集聚电子信息、家电、汽车、工业机器人、智能装备和消费级硬件等产业,工厂、仓库、物流和零售服务场景密集,积累了丰富的机器人、制造业等领域的真实物理世界应用场景。这些场景既是潜在市场,也是模型训练和迭代所需的真实物理环境。
机械臂。受访者供图。
张磊表示,这些多元化、高复杂度的实景场景,能够持续验证包括SpatialPoint在内的系列视觉原生模型的泛化能力,助力搭建“模型—机器人—真实环境—数据反馈”的完整技术闭环,持续优化物理AI的感知与决策能力。
在技术能力持续迭代的同时,团队也在探索相应的产业化路径,例如,通过模型、API和SDK输出基础能力;针对工业制造、仓储物流和零售服务等领域提供行业解决方案;进一步构建连接基础模型、机器人平台和行业应用的平台化能力。
“SpatialPoint是视启未来切入物理人工智能的技术节点。未来,SpatialPoint还将从空间理解和行动定位延伸至动态状态感知、未来预测和世界建模,全力推进超级物理智能的产业化进程。”张磊说。
热门跟贴