“判断一项技术是否真的成熟,最终要看它是否能实际解决问题,能否经受住真实业务的考验。”9月9日,京东云总裁曹鹏在“2026京东云大会”现场如是表示。

《每日经济新闻》记者现场观察到,这场一年一度的科技大会透露出两条清晰的行业信号:一是企业AI正从“给员工配工具”转向“给组织配AI数字员工”,办公范式面临底层重构;二是具身智能正集体走出Demo(演示),走向真实世界。

打开网易新闻 查看精彩图片

京东云大会现场 图片来源:每经记者 郑欣蔚 摄

但落地的门槛比想象中更硬:不是模型不够强,而是数据、算力、存储和组织流程还没接住。现场嘉宾形成的共识是:数据是物理AI最稀缺的燃料。

优必选副总裁、具身智能与人形机器人研究院院长焦继超直言,数据仍是“卡脖子的点”;京东探索研究院图像与多模态实验室主任黄浩洋也将“规模化、高质量、带动作标注的真实实操数据匮乏”视作限制机器人走进真实世界的核心变量。

更尖锐的分歧出现在语言模型上限方面。逆矩阵创始人陈博远以GPT-6操控夹爪拿杯子耗时近一小时为例,认为语言无法描述物理直觉,Token(词元)逐一生成的推理模式下,100毫秒的延迟在聊天窗口里几乎无感,但放在真机上“就是三个控制周期出去了”,物理AI必须有自己的基座模型;鹿明机器人创始人兼CEO喻超则持保留意见,认为配上合适表征系统,语言模型上限远未触顶。

Demo很漂亮,真实世界才是那堵墙。翻过它之前,谁掌握了数据,谁才有下一轮的门票。

具身智能走出Demo:数据是那堵墙

“AI正在从数字世界走向物理世界。而一旦走向物理世界,对基础设施提出的挑战会变得更大。”京东集团副总裁、京东云基础云业务负责人龚义成在演讲中提出,物理AI对算力、存力供给提出更高量级的要求。

其中,算力是训练和推理的底座,存力则要承接物理世界海量、多模态且快速膨胀的数据资产。“同时,面向物理AI世界的数据又极其稀缺。怎么把真实物理世界还原出来、重建出来、数字化,帮助模型和AI加速学习、快速落地,是另一个重要课题。”龚义成说。

数据是物理AI最稀缺的燃料,这一点在具身智能行业已成为共识。

黄浩洋将具身数据分为仿真数据、人类操作数据和真机数据等不同层次:仿真数据适合规模化预训练,人类操作数据能够连接人的动作与机器动作,真机数据则用于后训练和精细化操作。不同数据并非互相替代,而是共同构成“数据金字塔”。

值得一提的是,京东已经宣布将在两年内累计采集超过1000万个小时真实场景视频数据。

喻超结合企业实践认为,具身智能在真实场景落地时,对数据能力的要求极高——回流数据如何进入模型迭代,如何与前期数据做多元配比等,都是绕不开的难题。如果全靠人工调整,节奏太慢,必须借助类似代码化的自动化系统来进行增补和处理数据。

为此,鹿明机器人正在构建自己的数据闭环系统,作为任务闭环能力的载体。他以柔性质检为例介绍:最初团队自己采数据、做训练,但放到真实产线,第一次大概率跑不起来。之后要经过多轮迭代,根据实际运营情况调整回流数据,再针对特定案例补充数据。如此反复,设备运转时长、作业准确率等指标才能逐步提升。

物理AI需要自己的基座模型吗?

“限制机器人走进真实世界的变量有很多,最核心的还是智能化。”智元联合创始人、联席总裁姚卯青在圆桌对话中分享道。

姚卯青指出,提升智能化需要在三个方面突破:长程记忆与动态决策能力、精细化灵巧操作能力、自主纠错与重规划能力。只有这三项能力突破,机器人才能更好地在充满噪声和不确定性的复杂真实世界中完成任务闭环。

陈博远则从底层逻辑给出不同视角:尽管真实物理世界充满噪声和连续变化,但物理规律不会因场景切换而失效。

“2023年、2024年有各种垂类大语言模型,如今一个通用语言模型就能把各种垂类场景‘one for all’地解决。”陈博远说,语言模型能在学习理解语言知识的基础上实现推理预测,对于真实物理世界而言,人类能在习得物理规律基础上获取类似于“我能轻松拿起一个杯子”的物理直觉和本能,或许也能有一个理解人类物理直觉、本能的通用世界基座模型来实现真实物理世界的“one for all”。

对于这一通用世界基座模型的探索也是今年刚成立的逆矩阵着力的方向。陈博远认为,人类的物理本能并非只是来自感知,而是来自与真实世界的持续交互、试错和验证,因此构建物理AI基模的关键是从真实物理世界数据中提炼出“哪些动作导致哪些状态转化”的因果规律,在比像素和语言更高维的隐空间里压缩、抽象出可泛化的物理知识,同时让模型在真实场景中不断交互,通过强化学习形成完整闭环,试错密度越高,对物理世界的理解就越深。

“下一步,我们会在基模层拉高它的智能上限,有更强的智能模型才能把它放心地用在更深入、深刻的场景,获得高质量真实数据。另一方面,真实数据如何形成闭环更关键。这是一个从人到真机,再到虚拟平台的过程,但真实场景数据迭代失效速度极快,因此需要探索构建一个端边云协同平台,完成数据闭环。”陈博远表示。

陈博远还分享了他关注到的近两三个月行业的突破:GPT-6 Astra。这个被OpenAI称为当今世界智能水平最高、对齐表现最好的模型,在电脑操作、浏览器使用、软件工程、网络安全、科学研究和专业工作等领域实现进一步突破。它能像人一样“看”屏幕像素,模拟移动鼠标、敲击键盘,自主操作浏览器、办公软件和桌面应用,此类计算机操控、真机操控能力引发热议。

“大模型可以直接操控真机了,这确实让人震撼。”陈博远说,自己最近也曾尝试用GPT-6操作夹爪去拿一个杯子,花了四十分钟到一个小时才慢慢拿起来。

这个案例却让他对语言模型的上限进行了反思:语言能涵盖的只是你能用语言指令描述的内容,“我能想象怎么解鞋带,但用语言描述其实是解不出来的”。更关键的是时延。Token逐一生成的推理模式下,100毫秒的延迟在聊天窗口里几乎无感,但放在真机上“就是三个控制周期出去了”。真实物理世界时刻在变,动作还没执行完,新的挑战已经来了。因此,“物理AI必须有自己的基座模型,学习人类操作的范式、隐式的直觉和本能”。陈博远总结道。

喻超对“语言模型上限”的问题持保留意见。“GPT-6的能力可能不单纯是纯语言模型的上限。”喻超说,“给它配上合适的表征系统,不管是信号还是执行方面的,它的上限会高很多,具身模型的范式、甚至具身数据的范式也都可能被颠覆。”

对于近期的行业突破,姚卯青则提到主流视频大模型今年发生的质变。“视频模型能产生更好效果,关键在于更大的数据量。只要细节做对,确实可以延续像语言一样的scaling law(指模型性能随模型参数、数据量和计算资源增加而提升的规模化法则),而这些细节来自大量的数据标注工作。”他表示,同视频模型领域类似,相比于模型架构参数,数据体系质量、闭环能力或许也是具身领域更关键的长期壁垒。