机器人的视觉战争:一家中国公司的具身智能基建野心。
2026年7月,上海WAIC。
走进具身智能展区,一种混杂了焦虑与狂热的微妙氛围充斥着整个展馆。两年前的WAIC,这里只有18家企业吃螃蟹;去年已经飙升到80家;再到今年,参展数量已经悄然突破了200家。
比摩尔定律还快的增长速度背后,不仅有各种终端玩家在大放异彩;伴随模型算法的架构红利走到阶段性瓶颈,以宸境科技为代表,过去深藏在水底之下的数据Infra供应链玩家,也开始走到聚光灯下。
数据如何成为具身智能的阿喀琉斯之踵
要理解数据之于具身智能的重要性,自动驾驶就是一面最好的镜子。
把具身智能拆分成不同环节来看,其实智能驾驶,只是具身智能版图中的一个特定子任务。但强如特斯拉和国内一众造车新势力,在数百万用户数据源源不断上传云端的前提下,死磕了近十年的情况下,依然在面对各种离奇的Corner Cases时战战兢兢。
而具身智能所面对的场景,复杂度比自动驾驶高出了不止一个数量级:
第一层,是从二维到三维的几何升维:汽车只需要处理X-Y平面的移动,而机器人的手眼协调是在完全开放的三维空间里进行。
第二层,是自由度的指数级爆炸:汽车只有方向盘和油门刹车,人形机器人的自由度(DoF)动辄几十个,这意味着可能出现的动作范围呈指数级增加。
第三层,则是严重的数据不对称:相比自动驾驶,能提供优质数据反馈的机器人数量,少得可怜。
更关键的是,具身智能需要的不是普通的视频数据,而是带有空间结构和任务逻辑的具身经验。
“互联网上多的是海量的视频,但对具身智能来说,没有可靠位姿的视频只是垃圾素材。”宸境科技相关专家直言,“二维地图只需要描述平面,而机器人则需要知道自己在三维空间里的绝对位置、姿态、运动轨迹和任务状态。只有具备稳定轨迹、时间同步、空间对齐和质量评估的数据,才算得上是可训练的硅基经验。而这些,需要的是SLAM/VIO、鲁棒的6DoF轨迹、实时在线输出和轨迹评分等数据。”
过去一年多,宸境科技正是看准了这块数据荒漠,凭借Insight空间智能相机、TinyNav导航算法库等底层组件,拿下了一众头部大厂的合作。
但到了今年,宸境科技发现,行业的痛点,已经不止是单一的硬件或者导航算法。一套可规模化采集、可验证、可复用的数据闭环基础设施,才是让各大具身智能终端快速进化的根本。
也是因此,在今年的WAIC展台上,这家以物理AI基础设施为标签的公司,推出了两款代表性产品:Looper具身智能数采系统NavCore具身智能自主导航大脑
它们所针对的,正是具身智能行业在数据层面遇到的两大难题:真实世界的高质量数据如何规模化量产,以及机器人本体端如何实现高稳定的环境感知与自主导航。
Looper数采系统:给机器人装上第一视角学习能力
在具身智能数据采集的战场上,目前有三种主流技术路线:遥操作+VR、可穿戴多视角、固定多机位studio。
遥操作最大的优势是能够直接获得机器人动作数据,适合训练机器人执行策略。但它通常依赖专用设备,采集成本较高,效率有限,同时数据分布容易受到机器人本体形态和操作方式的限制。
固定多机位采集具有很强的可控性,可以获得高质量、多视角数据,但依赖特定场地和设备,难以覆盖家庭、工厂、商业环境中的大量真实任务和长尾场景。
考虑以上背景,Looper选择了Ego-centric多视角方案,它的核心理念是:让人类戴着机器人视角去完成任务,把人类数万年积累的肉身经验,无感地、低成本地转化为机器人看得懂的数字资产。
在业内看来,这种最接近人类完成任务时的感知方式,同时也是最有潜力、较低成本实现真实场景数据规模化的路线。
配置上,Looper采用了头部+双手的黄金组合多视角方案:头部Insight相机负责记录第一视角视觉信息、空间环境和自身运动轨迹;双手相机负责捕捉近距离操作细节,包括手部运动、物体交互和局部空间变化;背包端则提供边缘计算、同步记录和数据存储能力。
但这绝不是简单的把几个摄像头绑在身上录像。"采集数据容易,采集有效数据才是壁垒。Looper做的是采有效数据、采高质量数据。"宸境科技联合创始人兼首席运营官(COO)颜沁睿给我们举了个例子:数据采集过程中,多相机之间的空间和时间对齐是一个非常关键的行业难点。如果不同视角下的图像、深度信息、惯性数据(IMU)和位姿轨迹无法在同一个时空坐标系下保持高频同步,训练出来的机器人就会动作失调。
针对这个问题,宸境科技选择了在端上直接完成VSLAM的6自由度轨迹计算并输出的技术方案。
过去做具身智能的数据采集,行业通用的做法是采集一整天,拿回去用服务器离线跑几天三维重建,才发现数据对齐失败,整批报废。而Looper借助端上直接输出VSLAM,在现场就能实时知道每一帧画面的空间位置,不合格当场重测。
该方式的另一大优势则在于图像、IMU和6DoF(六自由度)轨迹在端侧天然对齐,后续的三维重建和任务切分成本呈断崖式下跌。
最终检索时,客户拿到的也不是一堆无序的视频文件,而是可以按照空间区域、运动轨迹、任务阶段精准检索的高质量经验包,真正让原始视频由此转化为真正可学习、可验证的数据。
据悉,宸境科技还正规划推出新一代四目大视场数采头环,核心优化方向为轻量化佩戴、无束缚自然采集。全新方案将还原人类分层感知逻辑:以余光兼顾全局环境,视线锁定身前交互物体,从感知底层完成机器人数据采集方案升级。
NavCore导航大脑:如何让机器人从能走路到会走路
如果说Looper解决的是数据生产问题,那么NavCore要解决的则是机器人的自主导航问题。
过去,具身智能公司在导航这件事上,过得像个高级系统集成商:
从A厂商买相机,去B厂商挑算力板,找C团队买定位算法,然后研发团队通宵达旦地写驱动、调校传感器、对齐时间戳。
作为这一切,现场部署中无线网络的频繁掉线、多板卡供电不均、接口适配等琐碎的脏活累活,往往也会吞噬掉研发团队大量时间。
此外,在整个链路中,相机的微小延迟会放大定位误差,定位误差会直接污染全局地图,地图更新慢了又会导致路径规划撞墙。任何一个环节抖动,都可能直接导致任务失败。
更不用说,横向对比过去的2D导航方案,3D导航在相同分辨率下,数据量会提升一个数量级以上,同时还会增加点云处理、碰撞检测和路径规划的计算压力。
软件算法的难度升级了,但硬件上面临的条件也更苛刻了:过去基于2D的自动驾驶,可以搭载的空间,是庞大的汽车;而具身智能需要把3D导航能力部署到低成本嵌入式平台上。
面对以上问题,作为具身智能的自主导航大脑,NavCore的做法是:大集成与标准化。它可以把复杂的机器人导航工程封装为可部署产品,使客户无需从零搭建感知、算力、建图、定位和导航链路。
硬件上,它以NVIDIA Jetson系列作为算力底座,深度融入全球主流开发者生态;同时将自研的Insight空间智能相机、计算、通信、电源管理进行模块化一体设计,降低集成复杂度。
这里面比较值得一提的是宸境科技自研的Insight空间智能相机,传统摄像头只要在固定机位把画面拍清楚就解决了90%的问题,但在具身智能场景,不仅需要高画质,还要有足够大的视场、极低的感知延迟、可靠的传感器同步,以及在振动、急转、弱光、强光和动态遮挡下持续输出稳定位置和姿态的能力。
这种需求决定了镜头、传感器、惯性测量单元、芯片和算法不能各自独立设计。为此,Insight采用了188度超广角视场、工业级惯性测量单元和端侧算力,在设备本地完成视觉定位、深度计算和空间感知,让具身智能不仅能看得见,也能精准理解复杂的空间关系。
而最终的软件算法上,宸境科技还通过算法裁剪、计算优化、硬件加速以及模型量化压缩,把原本需要服务器级别算力的空间智能,塞进了低成本的机器人端侧,还能长期稳定运行。
此外,考虑到过去很多机器人项目都需要针对不同本体,以及不同场景重新做一套系统集成,包括传感器选择、算力适配、驱动开发、坐标系标定、算法部署和现场调试等等。这导致机器人开发周期长,方案难以复制,也是行业规模化落地的重要瓶颈。
NavCore不仅内置了宸境硬核的TinyNav视觉导航算法,还可以提供基于ROS2的标准化接口输出。无论是人形、四足、AMR还是无人机,还是智慧园区全域空间感知与多机器人调度、工业巡检厘米级自主巡检与动态避障、港口物流复杂环境实时导航与任务执行、文旅导览智能路径引导与沉浸式讲解等场景,都能快速迁移、开箱即用。
通过对整个导航链路的底层重构,NavCore把整个行业最复杂、最容易踩坑的集成工作都以标准化接口输出。具身智能的研发团队,也就自然能够把有限的精力,释放到上层的任务智能和应用场景中,加速创新。
尾声
伴随场景从固定轨迹的简单Demo走向充满不确定性的现实场景,具身智能正迎来它的成人礼。
而未来三到五年,能否把数据闭环、感知导航、本体控制这些看不见的环节做扎实,会成为新的行业生存标准。
宸境科技在WAIC上交出的这两个答卷:Looper是要把人类在物理世界中沉淀了数万年的劳动力经验,低成本、规模化地编码进数字世界;NavCore在物理世界的连续性与不可逆性中,为机器人画出确定性的行进路线,或许正是其中关键。
也只有无限的人类经验开始通过标准化的管道源源不断地喂养模型,自主导航的工程门槛被降低到开箱即用,具身智能才有可能真正跨越从昂贵Demo到通用劳动力的关键一步。
热门跟贴