打开网易新闻 查看精彩图片

·聚焦:人工智能、芯片等行业

欢迎各位客官关注、转发

前言:

大模型学会聊天之后,开始学着「过日子」了。近日,京东把实时可交互世界模型JoyAI-Echo WM摆上开源社区;字节被曝把各模型方向中最高的资金投入,压向了同一个靶心。

作者| 方文三

图片来源 | 网络

打开网易新闻 查看精彩图片

AI「补课」物理常识,世界模型成了最贵的学分

世界模型内核朴素,让AI在脑子里装下世界的规律。杯子松手落地,拐角后有遮挡。语言模型熟读全部文字,却没端过一杯水,迈不进物理世界的跛脚就在这。

Genie 3生成可探索环境,V-JEPA 2做机器人规划,Cosmos定位Physical AI底座。它早不该被归进视频生成赛道,视频生成只答下一帧,空间智能还得追问物体在哪、动作带来什么。

热度遮不住边界,视觉合理不等于物理准确,门看着能开,未必懂门轴和摩擦。

李飞飞拆解冷静,渲染、模拟、规划三位一体,最难啃的是模拟器。世界模型如今大致相当于2019年的语言模型,密码还没破。

冷静拦不住热钱,World Labs融资12.3亿美元,估值50亿美元,英伟达与AMD罕见同框。

国内前7个月一级市场砸进666亿元,64家公司58家拿到融资。

钱在抢跑,尺子还没造好,连世界模型都没共识,质变或许要等到2028年。收入那头,至今没人披露过规模化进账,技术还住在demo里,门票已开卖,行话叫期货。

可账本另一端诱人,IDC测算中国具身机器人支出从2025年14亿美元蹿到2030年770亿美元,年复合增速94%。国务院发展研究中心更乐观,预计2035年破万亿。

打开网易新闻 查看精彩图片

字节不缺模型,缺的是下一块屏幕

字节闯入世界模型的姿态很字节,承认来晚,然后加倍下注。

2024年周畅从阿里通义加盟,内部判断路线未明,先打视频模型的仗。2025年两支VLA成军,一路吃仿真数据,一路吃自然数据。

2026年春节后牌桌重洗,Seed新设世界模型研究组,前Meta FAIR研究员范浩奇挂帅,走3D仿真路线瞄准游戏娱乐,两支VLA合并归入周畅麾下,Seed Robotics随后并入。

钱的流向更诚实,世界模型数据预算数千万元,是其他厂商的3到4倍。年底对标Google Genie 3,差距约10%。豆包DAU已破2亿,全球最肥的一块AI流量田。

字节的焦虑是结构性的,抖音把二维信息流做到注意力极限,用户时长和广告加载率都有物理上限,文本牌桌只排第8,推荐引擎需要一块装得下下一次生命的新屏幕。

打开网易新闻 查看精彩图片

硬件是它交过学费的地方,2021年90亿元抢下Pico,2022年PICO 4发布喊出销量破100万台。3个月后ChatGPT出世,风向掉头,次年目标腰斩到50万台。2023年二季度中国VR/AR头显只卖出15.6万台,同比减半。每一代头显的墓碑上刻着同一个死因,内容荒。

世界模型恰好能治这个病,Seedance 2.5单次生成拉到30秒,可消化50个参考素材。Seed3D 2.0输出带关节、可拆分、可进仿真引擎的3D资产,被称半个世界模型。9月的目标参数值得咀嚼,端到端延迟约50毫秒,每秒约20帧,画面全部云端生成。

50毫秒是一道门槛,人眼对延迟的容忍阈值在50到100毫秒,低于这道线,大脑会把虚拟空间误判为真实在场,VR行业卡了10年。

云端生成顺手改写成本结构,头显只剩显示和传感,VR从硬件生意变成云服务生意。原定9月的Pico Space Pro推迟到四季度,等的显然就是这口气。

把推荐引擎从二维屏幕搬进三维空间,让内容像自来水一样实时生成,内容荒这个老死因才被连根拔除。这与其说是技术野心,不如说是一个内容帝国的形态自救。

打开网易新闻 查看精彩图片

京东把供应链搬进了仿真器

京东做世界模型,画风与别家不同。这家公司的弹药库里没有日活神话,有的是别人抄不走的东西,20多年供应链、60万一线员工,和全中国密度最高的物理场景。

JDD大会上,京东开源JoyAI-Echo WM。它随用户移动持续生成场景,同步输出720P视频、环境音与语音,支持多轮交互,在WBench Navigation评测中以81.6分登顶。

打开网易新闻 查看精彩图片

模型只是水面上露出的尖,水面之下,京东计划两年采集超1000万小时人类真实场景视频,建设全球最大的具身智能数据采集中心,开源的行业最大第一视角数据集EgoLive覆盖1969类物体、1796种动作,引来8个国家上百所高校申请。

这笔账算得清楚,机器人最贵的一课是摔跤,真实试错按小时计费,遥操作采集一小时动辄数万美元。仿真把摔跤搬进虚拟世界,成本趋近于电费。

京东恰好握着中国最完整的可仿真现实,仓库、分拣线、配送站、无人车,每天产出带动作标签的物理数据,这类数据在游戏视频里长不出来。

卡位动作密不透风,未来5年采购300万台机器人、100万台无人车、10万架无人机,全国布局80个RoboBase基地,JoyInside牵手近200个硬件品牌,年内接入终端超千万台,投资名单从智元、逐际动力、众擎排到帕西尼,本体、零部件、具身模型全链条通吃。

这家公司在做一笔资产重估,把20年攒下的供应链从成本中心改写为AI时代的训练场。

打开网易新闻 查看精彩图片

入口是面子,收租权是里子

舆论爱讲入口之争,这个词值得拆开验货。

押宝头显入口,是2016年VR元年就演过的剧本。Vision Pro卖了两年多仍是富人的玩具,Quest守着小众盘子,Pico刚从寒冬里缓过气。硬件这道门,还远远没装上。

卡位的真正对象,是空间计算时代的生产成本定义权。

字节押空间内容的生产成本趋零,内容荒消失后,它向内容产业收生成税。

京东押物理作业的试错成本趋零,机器人上岗前都在它的仿真里练手,它向机器人产业收仿真税。

两家排的是同一个售票处的两个窗口,卖的都是2028年的票。

生态动作都在为收租铺路,字节自研加投资,影眸科技、生数科技、自变量机器人陆续进了购物车。

京东投资加渠道加地产,200多个品牌接入JoyInside,80个基地圈地,1000万小时数据持续喂养模型。

两边的算盘都清楚,世界模型成熟那天,平台上跑着别人生意的那家,就成了事实标准。

软肋也该摆上桌面,字节的二维信息流与三维实时交互隔着技术代差,Pico的前科提醒市场,这家公司的硬件耐心不算长。

京东场景全是自家的,数据闭环漂亮,可操作系统的价值取决于第三方数量,它的世界模型眼下最大的客户恐怕只有自己。

两家争夺的底层是同一种能力,持续的空间理解。字节握着模型、内容生态和终端,京东握着供应链、物流和可验证的物理场景,两家都还没有闭环。

打开网易新闻 查看精彩图片

结尾:

拼模型像不像世界的阶段正在退潮,拼谁的世界装得下别人生意的阶段正在涨潮。

世界模型的战略价值,可能远超模型API本身。

部分资料参考:京东探索研究院:《From AI Models to the Physical World: Highlights from JDDiscovery 2026》,字节跳动Seed:《Seed Research: BAGEL, The Open-Source Unified Multimodal Model, An All-in-One Model》,Meta AI Research:《V-JEPA 2: Advancing World Models for Physical AI》

本公众号所刊发稿件及图片来源于网络,仅用于交流使用,如有侵权请联系回复,我们收到信息后会在24小时内处理。

请务必注明:

「姓名 + 公司 + 合作需求」