当你对着智能音箱说“我出门了”,最理想的状况是灯光关闭、窗帘拉上、扫地机器人开始工作。但现实中,不同品牌设备的协同往往需要手动设置场景。京东在本届世界人工智能大会(WAIC)上展示的JoyInside,正是想在中枢和终端之间,补上那层让设备自动协作的“交互胶水”。

这背后是京东从数字服务向物理世界延伸的战略转向。今年WAIC,机器人及智能硬件企业占比高达23.6%,成为最热赛道。京东则以“AI进入物理世界”为主题,首次系统展出了其在具身智能和全屋智能上的布局。

打开网易新闻 查看精彩图片

核心抓手JoyInside已经拉拢了近200家硬件品牌,覆盖家电、机器人、玩具、健康设备等领域。据现场公布的数据,接入这一中间层的设备,平均对话轮次提升了120%以上。用户和硬件之间的交互不再是一问一答的“回合制”,而是能够基于上下文连续推进。

京东科技AI创新业务负责人戴文军解释,JoyInside并非底层操作系统,它承担的角色是跨设备、跨场景、多用户之间的协同调度。今年该项目计划接入超过1000万台终端。为了降低品牌方的接入门槛,京东免费提供自动语音识别、语音合成及大模型交互能力,硬件端只涉及模组增量成本。

同时,京东零售渠道为合作硬件提供新品首发、线上销售和售后维修的一体化支持。这套“技术免费+渠道绑定”的打法,和当下小米、华为、海尔等厂商的全屋智能生态思路类似。区别在于,京东的护城河不在于技术独占性,而在于其电商平台的履约能力和用户触达效率。

正方观点认为,京东的真实零售和物流场景,为AI硬件落地提供了不可替代的试验场。用户在家下单后,京东物流配送的机器人已经在仓储里跑数据;家庭场景中,设备联网后的交互数据又能反哺模型。这种商业闭环,让京东在物理AI的数据积累上具备一定先发优势。

但反方则指出,京东的短板同样明显——它不具备机器人整机的规模化制造能力。相比于优必选、宇树等专业厂商,京东更像一个“数据房东”和“渠道商”。一旦硬件厂商自建数据闭环或选择其他AI平台,JoyInside的生态粘性将面临考验。

这种两难也体现在京东的阶梯式技术架构中。京东集团副总裁、探索研究院副院长段楠描绘了三个层级:数字智能(JoyAI多模态大模型底座)、附身智能(将模型轻量化搭载到硬件,实现从单品到空间的升级)、通用具身智能(机器人在真实空间自主作业)。这一架构的底层依靠真实数据采集、仿真合成和真机验证的闭环。段楠承认,目前全球具身智能尚未出现标志性的“GPT-3时刻”,模型泛化、评测标准和跨本体迁移都还处于单点突破期。

此外,京东在基础模型上并非毫无建树。JoyAI多模态大模型底座已覆盖图像、语音、视频和实时交互等领域,部分成果已在Hugging Face和GitHub上开源。围绕具身智能的工具链,如EgoLive第一视角数据集和JoyAI-Sim仿真合成工具,也在逐步补全。这些技术储备让京东在数据采集和模型训练上得以形成闭环,但能否转化为硬件落地的竞争力,仍取决于与终端厂商的协同深度。

数据规模成为破局的关键变量。京东集团副总裁龚义成宣布,计划在两年内积累1000万小时高质量具身数据。这个数字背后是行业共识的迁移:此前业界普遍认为百万小时数据即可满足训练需求,但随着模型泛化要求提高,千万小时量级正在成为新门槛。

但数据的“高质量”如何定义,仍是悬而未决的问题。龚义成在现场直言,脱离模型和真机验证的采集数据只是表面素材,真正有价值的数据必须走完采集、处理、训练、真机验证的端到端闭环。这也点出了当前行业的普遍瓶颈——适配机器人训练的高质量物理交互数据依然匮乏,数据竞赛远未到终局。

京东的立场是,把1000万小时视为一个基于模型迭代需求的阶段性规模,而非终点。在这场数据储备战中,智元、优必选等企业也在用自己的方式扩库。先跑通可复用的数据闭环,谁就能在下一个阶段的具身智能竞争中占据主动。

回到战略定位,段楠表示,京东内部衡量AI业务的核心指标是体验、成本和效率,现阶段以高质量数据规模化作为核心抓手。但他同时承认,未来具身智能行业不可能一家独大,开放共建是必然趋势。这种表态本身,说明京东在物理AI这条赛道上的边界仍在摸索。它既不像纯AI公司那样押注通用模型,也不像硬件厂商那样追求整机出货量,而是试图用“数据+渠道”的方式,在亚马逊和特斯拉式路线之间寻找第三条路。

一个现实的注脚是,JoyInside接入的千万台终端,最终能否沉淀出真正有效的交互数据,并支撑起从附身智能到通用具身智能的跨越,还需等待硬件规模落地后的实际表现。在那之前,京东的物理AI故事,仍处在从0到1的阶段。