在一个AI开始长出手脚的时代,一副头戴相机,就能把人类每天重复的动作,炼成下一轮产业竞争最值钱的筹码。

7月18日,上海世博展览馆。

京东给WAIC观众搭了一套“AIHome”:台灯批改作业,床垫记录睡眠状态,机器狗在客厅里回应指令;另一边,观众戴上JoyEgoCam整理货架、拿取商品,人的第一视角动作随即被记录,经过后续处理转换成机器人可以学习的数据。

镜头里,这是一场智能硬件展。

把京东采访的信息放在一起,画面的重点开始变化:床垫、台灯和机器狗展现AI的实用性;数据采集设备、视频生成模型和评测平台,真正决定了AI能否进入物理世界。

这恰好踩中了今年WAIC的热点,官方学术议程已经把具身世界模型、世界动作模型以及规模化落地列入专题讨论。“机器人能否理解动作将带来什么后果”,正越来越被行业所重视

于是问题来了,京东当前最想做的,究竟是什么?

答案其实没有那么神秘:京东以高质量具身数据为起点,推进多模态理解、视频世界模型与具身模型研发,再将物流、零售、家庭等真实业务场景为评测场,把数字AI推进到物理AI。

简而言之,就是让AI拥有大脑,能理解、预测并操作现实世界,并放进多种真实场景中反复验证。

打开网易新闻 查看精彩图片

一条三段式路线,两个不同速度

一条三段式路线,两个不同速度

京东探索研究院把路线分成长期并行的三层。

第一层是数字智能,大语言模型、代码模型、多模态模型和智能体继续充当底座。

第二层是附身智能,AI被装进电子产品和家具,重点是实时感知、多模态交互和连续服务。

第三层是具身智能,模型扩展到机器人等具身硬件,开始理解空间和物理规律,预测环境变化,并学习在真实环境中完成抓取搬运等物理操作。

换而言之,前期附身智能解决AI怎样持续感知和回应人,后期具身智能解决AI怎样理解物理世界并完成动作。

JoyInside则是现阶段附身智能进入家庭的重要入口,在通用机器人尚未成熟时,家庭空间先被拆成台灯、床垫、机器狗等多个角色承接不同服务,云端大模型和场景引擎再把它们连接起来。

打开网易新闻 查看精彩图片

第一张底牌,是高质量数据

第一张底牌,是高质量数据

具身智能眼下最缺的资源,京东判断为高质量的物理世界数据。

公司已经把第一视角视频、多模态感知、手部力学、导航和全身轨迹纳入采集范围,覆盖家庭、物流、工业和汽车维修等场景。公开目标指向京东计划在两年内1000万小时人类真实数据,并在WAIC期间宣布已开源行业最大的人类第一视角数据集EgoLive。

千万小时看起来很多,但规模只是具身智能的入场券。

京东做过一次对照,分别用1万小时高质量数据和1万小时存在瑕疵的数据训练模型,后者数据量没有减少,模型在部分任务中的理解、泛化和准确率却可能下降。

这场实验点醒的,是人们对AI训练的常见幻觉。视频拍得越多,机器人并不一定越聪明,数据质量需要由模型和任务倒推定义。采集设备记录什么精度,动作轨迹如何抽取,缺失信息怎样重建,哪些数据进入预训练和后训练,最后都要回到真机任务中验证。

因此,京东把链路拉到了“采、存、标、训、评、仿、测”。

数据从现实世界进入模型,模型在仿真环境中学习,再回到仓库、门店和家庭执行任务,在真实场景中验证,执行结果继续修正下一轮采集,形成数据、模型与场景的闭环。严谨的数据飞轮,才是1000万小时真正的含义。

当然,规模化还要算成本。京东称其数据处理成本较去年已下降10倍以上。高质量决定模型上限,高性价比决定这套系统能否持续扩张。

第二张底牌,是视频世界模型

第二张底牌,是视频世界模型

数据之后,京东押注的模型路径开始浮出水面。

现有视觉—语言—动作模型擅长把观察和指令映射成动作。世界动作模型再向前一步,模型先预测某个动作将怎样改变环境,再从预测结果中选择行动。

它需要学习物体、空间、时间、因果和动作之间的关系。相关研究也把第一视角人类示范、仿真数据和互联网视频视为这一方向的重要数据来源。

在机器人的具体实践里,看到矿泉水瓶并伸手抓取,只完成了基础的识别与动作映射。除此之外,机器人仍要预测抓取轨迹、受力结果和失败代价,并扩展到不同品牌、不同大小和形态的瓶子,来应对现实应用场景中多变的环境。

京东也给视频生成模型安排了两份工作:一份用于内容生产,一份用于物理世界模拟和合成数据。

JoyAI-Echo探索分钟级长视频和音视频一致性,JoyAI-Image-Edit强化空间理解,JoyAI-VL-Interaction负责实时多模态交互,JoyAI-Sim连接真实数据与仿真训练。京东探索研究院还明确提出,今年下半年将推进多模态理解旗舰模型和视频世界模型。

因此,“具身化世界模型”可以作为理解京东当前AI战略的核心关键词。硬件本体目前处于探索位,数据、模型和评测已经进入主航道。

打开网易新闻 查看精彩图片

第三张底牌,是场景和入口

第三张底牌,是场景和入口

具身化世界模型最怕什么,消费者最担心什么?是在演示视频里样样精通,进了仓库就死机。

目前,一般语言模型已经有标化考试成绩作为可验证环境,但具身智能目前缺少统一的物理考场。

京东手里的物流仓、门店、工业园区、健康业务和家庭设备,正好可以填上这个缺口。在物流场景,机器人可以接受导航、分拣、搬运和理货测试;在零售场景,可以测试拣货、补货和商品询问;在健康场景,可以探索药房抓药;在工业场景,可以测试巡检和供应链操作。

京东为模型安排的考题主要是三大板块:效率、成本和用户体验。

用京东的AI智采管家举例,东莞一家60人规模的精密五金厂,过去整理15项物料需求需要一天,AI智采管家1分钟完成清单解析,10分钟完成核对和采购发起。京东工业披露,客户选品时间普遍缩短60%以上。

京东对AI的期待,是从给答案走向完成任务。

JoyInside则在抢家庭端入口。

它已经与超过200个品牌合作,预计2026年接入超过千万台终端,打造物理世界最大的AI去中心化入口。

打开网易新闻 查看精彩图片

世界模型仍欠几道硬题

世界模型仍欠几道硬题

首先,具身智能目前仍处于早期阶段,京东内部判断甚至尚未到达“GPT-3时刻”。现有模型在跨任务、跨场景和跨本体迁移方面缺乏稳定表现,规模定律也没有得到完整验证。行业仍缺少统一的数据标准、评测标准和可验证的物理环境。

AI下半场,值得盯住这四个信号

AI下半场,值得盯住这四个信号

看京东下半年的多模态理解模型和视频世界模型能否如期推出;看千万小时数据能否转化为可重复的任务提升;看JoyInside能否提高家居家电等品类的使用频次并跑通多设备协同;看京东能否把评测、数据和合作伙伴体系做成行业规范标准。

在WAIC展台上,机器狗挥手、床垫说话,最容易吸引人群。

京东更大的下注,藏在展台后面。让AI向千万小时的人类动作中学习,在模型里预测动作后果,在仓库和家庭中接受验证,再把结果送回真实世界。

参数榜单的领先只是一瞬,谁能把数据、模型、场景和责任闭环接起来,谁才可能拿到物理世界的标准定义权。

下一轮AI的门槛,可能就藏在一台看似普通的床垫、一副头戴相机,以及一次必须成功的抓取里。

打开网易新闻 查看精彩图片