在2024世界人工智能大会上,具身智能机器人依旧是最吸睛的展品,它们能冲咖啡、打乒乓球,但热闹的展台背后,一个冰冷的问题始终未解:当聚光灯熄灭,这些机器人何时才能真正走进工厂和家庭,扛起“干活”的重担?从炫技式的演示迈向规模化的实际应用,中间横亘着数据、模型和终端落地三座大山,而京东的全栈实践正在试图给出一个答案。

第一座大山是数据饥渴。机器人没有像互联网那样的海量真实交互数据可供训练,仅靠实验室里采集的有限动作样本,根本无法覆盖开放场景中的长尾问题。京东选择从自身物流和零售的丰富场景切入,构建了一套从真实订单、仓储搬运到末端配送的闭环数据采集体系,让机器人在真实的货架间摔倒再爬起,而不是在模拟器里永远一帆风顺。

打开网易新闻 查看精彩图片

第二座大山是模型泛化能力不足。具身智能不能只是“背诵”特定任务,它需要像人一样,面对从未见过的杂物堆也能规划出抓取路径。京东物流联合多家研究机构,在视觉-语言-动作多模态基础模型上发力,让机械臂即使见到包装破损、货品倾倒等意外情况,也能根据语义指令自主调整策略,而不会卡死等待人工复位。

第三座大山是端侧部署的刚性约束。云端大模型延迟高、成本不可控,真正的作业机器人必须将算力压缩到边缘端。京东在自研的仿人机械手和自主移动平台上,把经过剪枝蒸馏的轻量化模型直接嵌入端侧芯片,确保在毫秒级延迟下完成精细操作,同时功耗和散热能满足长达8小时的连续拣选任务。

这三座大山并非孤立存在,京东所构建的“数据-模型-终端-场景”全栈闭环正在把它们连根拔起:真实场景产生增量数据,数据喂养更鲁棒的模型,模型部署到终端后进一步采集长尾样本,再回流优化。虽然距离“万能机器人管家”还有很长一段路,但至少从仓库到门店,具身智能已经开始撕掉“表演艺术家”的标签,挽起袖子真正干活了。