Robbyant表示,此次发布标志着机器人空间感知领域迈出的重要一步,有助于机器人更精准地认知物理世界,并提升在复杂环境中自主行动的能力。
LingBot-Depth引入了掩码深度建模(MDM)技术,用于解决透明和反光表面深度感知的难题。在此基础上,LingBot-Depth 2.0进一步扩展了训练能力,性能也有提升。
该模型在1.5亿个样本上进行了训练,并在16项深度补全基准测试中,有12项取得了领先成绩,在实际感知任务中展现出更高的准确性和可靠性。
AI 模型帮机器人解决深度感知难题
LingBot-Depth 2.0 实现了在深度感知经常受限的复杂室内环境中,表现有了明显提升。据 Robbyant 称,在深度损失严重的场景中,该模型跟上一代比将深度误差降低了一半以上,将 RMSE 分数从 0.132 降到了 0.062。
在传统深度相机通常搞不定的场景里,这个模型也表现得更好,比如识别和理解玻璃、镜子以及其他透明物体。
这家中国公司把这些成果归功于LingBot-Vision,这是一个视觉基础模型,目的是让机器人更好地看懂和理解周围环境。该模型是业内第一个把“边界结构”用作预训练目标的,这样一来,它就能实现亚像素级的边界定位,对空间结构的理解也更强,让机器人的感知更可靠。
虽然LingBot-Vision只用了相对较小的1.6亿张图像数据集来训练,但和更大的模型相比,它的表现依然很出色。Robbyant表示,该模型还能稳定地检测物体边界,让机器人能在连续的视频画面里持续追踪物体的边缘和结构。
LingBot-Depth 2.0 通过商业机器人应用验证
除了驱动 LingBot-Depth 2.0 之外,LingBot-Vision 还被定位为一个灵活的基础模型,可支持各类 AI 应用及后续任务。Robbyant 表示,该模型的功能不仅限于深度感知,还能在机器人视觉和智能系统中拓展更多应用场景。
面向商业部署,LingBot-Depth 2.0 已通过奥比中光深度视觉实验室的认证。使用奥比中光 Gemini 330 系列双目 3D 相机的芯片级深度数据进行测试,结果显示其在边缘检测、物体轮廓提取、小物体识别、远距离深度估计以及在复杂光照和材质条件下的表现均有提升。
与奥比中光的合作还将扩展到用于机器人数据采集的新硬件解决方案。作为奥比中光新推出的免机器人数据采集硬件平台的一部分,RGB-D EGO 设备将配备定制版的 LingBot-Depth,该版本专为采集高质量训练数据而优化。
在未来的更新中,该平台预计将集成该模型的高级商用版本,进一步提升深度补全、物体边界检测和空间结构理解等方面的能力。目标是为在真实环境中训练具身人工智能系统提供更准确、更稳定、更实用的数据基础。
热门跟贴