编辑|Sia
「 Egocentric data boom 」
9 月 3 日,OpenAI 正式发布 GPT-6 Astra。在 ARC-AGI-3(一个考验 AI 能否在陌生环境中自主探索、理解规则并规划行动的 Benchmark),Astra 拿下99.9%,并在 96% 的关卡中达到或超过人类的行动效率基准。
一天后,Robocurve 将它接入真实双臂机器人,在「抓起积木并放进碗里」的任务中,20 次成功 19 次。
这两个结果释放出的信号是:最前沿的大模型正在把能力边界从数字世界继续推向物理世界。当模型不再只是回答问题,而是需要观察环境、规划下一步并实际完成任务,它所面对的数据问题也随之发生变化。
今年八月,Dyna Robotics 第一次将人类经验( 第一人称视角数据,也叫做 egocentric data )相关的规模推到了100 万小时。
从 1000 小时逐档增加到 100 万小时,Dyna-2 的预测表现持续改善,没有明显吃饱的迹象。在预训练阶段没有见过的机器人任务中,Dyna-2 依然展现出更强的泛化能力。
Genesis AI 的首个机器人基础模型 GENE-26.5 也采用了 egocentric data,将真实人类活动中的视觉、动作与交互过程纳入模型训练。
这些实践共同指向一个变化:机器人训练正在开始吸收可以大规模的人类真实活动。
大模型曾经依靠互联网完成 Scaling,而机器人长期受限于真机数据——采集昂贵、积累缓慢,还往往绑定特定本体。如今,一条新的 Scaling 轴正在变得清晰:人类经验。
《连线》写到,一场 「egocentric data boom」正在兴起。越来越多机器人公司转向采集员佩戴摄像头产生的 egocentric video,甚至有投资人预计领先公司未来几年会购买数亿小时的 egocentric data。
问题是,谁能把这些视频里的经验,持续、高效地变成模型可用的训练数据?
在 Dyna-2 和 GENE-26.5 惊艳表现的背后,一个共同的「卖水人」浮出水面:Maxinsights。
它既是Dyna-2 最大的数据合作伙伴,也是 GENE-26.5 的独家egocentric data合作伙伴,Google DeepMind、Figure、1X 以及某头部大模型公司等也曾与其开展数据合作。
这家 2024 年成立于旧金山湾区的 Physical AI 公司,已经将数据服务铺到六大洲,并于今年 3 月进入中国市场。
Maxinsights:最早实现规模化、且累计交付量最大的第一视角数据公司
Maxinsights 不仅是最早的 Ego data 公司,也是最早上量的一家。
其团队核心成员来自 Waymo, Meta, Google, QCraft, XPENG, Bosch 等自动驾驶与 AI 领域公司,具备从数据采集、清洗、算法、标注到模型训练的完整工程经验。
这套曾支撑自动驾驶发展的数据闭环能力,正在被迁移到 Physical AI 领域。
随着与硅谷 Foundation Model 和 Robotics 团队合作不断深入,Maxinsights 逐渐扩展到大规模 egocentric human experience 数据,搭建覆盖数据采集、质量控制、理解、标注到模型训练交付的完整基础设施。
这一转变背后,是机器人学习对真实世界经验的需求。机器人采集的操作数据往往与具体硬件和任务环境相关,而人类每天都在不同场景中完成大量物理交互。拿起杯子、整理物品、打开抽屉、使用工具,这些日常动作记录了物体如何响应接触、双手如何协作,以及环境状态如何随着动作发生变化。
Dyna Robotics 也在 Dyna-2 技术报告中指出:
人类执行真实任务时产生的 sensorized recording,规模几乎没有上限,同时包含了机器人 manipulation policy 所需要学习的世界动态和手物交互信息。
换句话说,如果机器人想获得类似互联网数据规模的训练资源,未必需要等机器人自己工作几亿小时。它可以先学习已经在人类世界中运行了无数年的经验库。
对于 Maxinsights 而言,将这些人类经验转化为可用于训练的数据,已经进入规模化生产阶段。
截至目前,公司建立了覆盖六大洲的采集网络,累计积累 150 万+小时带手部追踪和语言标注、可直接用于训练的高质量数据,历史累计向客户交付超过 200 万小时。
而它之所以能在具身智能数据链顶端站稳脚跟,靠的并不只是庞大的「视频仓库」,更是一座「智能工厂」。
它配备了最前沿的模型算法和高度自动化的流水线,源源不断地将原始的人类视频,提纯、加工成行业亟需的 robot training-ready 训练数据。
精品150 万小时数据,远离「盲目上量」
当数据规模跨过百万小时的大关,单纯靠堆人、堆规模的边际效益已经开始递减。
具身智能的数据之战,底层逻辑变了。
这也正是 Maxinsights 最有远见的一步棋:他们真正在意的,不再是每个月还能多采多少小时,而是如何把人类数据与机器数据之间的 Embodiment Gap(跨本体差异),降维成一个可以通过流程和算法解决的工程问题。
根据他们的观察,未来具身智能的数据能力,会沿着两个方向同时演进。
其中一个是Experience Scale(经验规模)。
机器人需要接触足够丰富的人类活动、环境、物体和任务,才能逐渐形成对物理世界的通用理解。
因此,数据规模仍然重要。行业会继续从百万小时走向千万小时,甚至更大规模,让人类经验成为训练通用机器人模型的重要基础。
但规模扩大之后,另一个问题也越来越突出:模型看到了更多视频,却没有看到更多新的世界。
如果新增的数据只是重复已有场景,那么数量增长并不会带来同等程度的能力增长。
这种对有效数据的高度需求,首先会传导到采集基础设施上。Maxinsights 给出的解法,是让数据采集本身具备主动规划能力,也就是Coverage-aware Collection。
当数据规模进入百万小时之后,传统的被动采集方式会越来越容易暴露问题:辛辛苦苦采回来的第 1000 万小时数据,大概率成为早期数据的低质复刻。
满屏都是固定环境下的简单搬运、桌面抓取,规模上去了,系统却免疫了。
盲目上量行不通,那就主动寻找数据缺口。
依托内部的 Agent 平台,Maxinsights 可以对现有的数据池进行反向诊断,像雷达一样锁定数据分布的盲区。一旦发现稀缺环境、罕见物体或是复杂的受力动作,Agent 会立刻下发指令,定向调度全球 5000 余名采集员和专业设备进行补采。
例如,缺少厨房环境中的长尾物体,就安排对应采集;缺少柔性物体操作,就补充相关任务;缺少复杂受力状态,就针对性设计采集流程。
这套流水线还自带数据清洗功能,能自动识别并剔除无效片段、刻意摆拍和摄像头视角偏移等低质数据。
自有模型才是数据公司的技术壁垒
除了 Experience Scale,Maxinsights 观察到的第二个关键趋势是Experience Density(经验密度)。
一小时的人类操作视频,有的数据只能告诉模型:手移动到了某个位置。但更高价值的数据,会包含更多维度的信息。
比如,手部姿态、身体协同、物体状态变化、人与环境之间的接触关系、动作过程中的时间节奏。
这些信息越丰富,模型能够学习到的物理规律就越多。未来高价值的具身数据,并不是简单追求更多小时,而是让每一个小时承载更多关于真实世界的信息。
因此,数采之后,如何进一步理解、拆解和加工这些原始人类经验,把它们转化为机器人真正可以学习的训练信号,决定了数据价值的上限。
换句话说,真正重要的问题是:如何充分释放每一帧画面中的信息价值?
Maxinsights 的解题思路是从关注 Task Coverage(任务覆盖),转向更细粒度 State Coverage(状态覆盖)。
下面这段演示中,视频不再被压缩成一句 Caption,而是变成一个由场景理解、任务边界、三维空间关系、双手微操轨迹、动作时间序列紧密咬合的高维数据结构。
它尽可能保留了人类操作过程的空间、动作与时序信息,让视频变成 Dyna-2 这类模型可以直接用于学习物理交互规律的训练数据。
支撑这套数据加工管线的,是 Maxinsights 自研的核心 AI 引擎。
作为专门针对具身场景强化过的视频理解大模型,MaxVLM 负责从视频中提取高阶语义。
在一段视频演示中,系统并没有敷衍地打上一个「打扫卫生」的粗糙标签,而是建立起了一棵严密的逻辑树:
- ENVIRONMENT(环境): Hotel room
- TASK(主任务): Clean the room
- SUBTASK(子任务): 随着时间轴,精准切分出 Collect the trash(收垃圾)、Wipe the table(擦桌子)、Discard the water bottles(丢水瓶)、Tie off the trash bag(扎垃圾袋)等具体环节。
- INSTRUCTION(微操指令): 细化到了每一只手在干什么。 比如,双手将桌子上的纸屑扔进垃圾桶。
据透露,MaxVLM 在具身场景下的语言标注和视频理解能力,能直接对标公开SOTA视频理解模型的水平,但其推理成本被压缩到了十分之一。这种成本控制力,是撑起百万小时数据量产的生死线。
视频右侧的画面,是被重建出的 3D 点云空间。
画面中随着手部移动而绘制出的彩色线条,正是系统从第一视角视频中脑补并逆向推导出的双手在三维空间中的精确运动轨迹。
为了把运动轨迹做得足够稳定、精确,Maxinsights 沿用了自动驾驶领域的 SLAM 算法——先持续估计摄像头自身在三维空间中的位置与姿态变化,再将每一帧里的手部位置统一映射到同一个世界坐标系中。
这样一来,头部晃动和相机位移带来的干扰就能被尽可能剥离,留下更接近真实动作的双手运动轨迹。即使视频中有时手部会发生遮挡,或者镜头随头部晃动,右侧的空间坐标依然保持稳定追踪。
第一个提出 Yield:数据量要大,也要死磕「良率」
当这套自动化基础设施彻底贯通,数据飞轮便开始转动:
更聪明的主动采集——更强的模型理解与 3D 还原能力——自动质检与标注精度提升——数据边际生产成本有望下降——吞吐量级更大的人类经验。
当很多同行还在讨论采到了多少视频时,Maxinsights 已经率先提出一个工业色彩十足的概念——Yield(良率)——工业化生产时代,数据良率高低,才是决定一套数据 Infra 能否撑起大规模 Scaling 的关键指标。
关注芯片圈的人对良率这个词绝不陌生。
在半导体制造领域,晶圆下线,并非每一颗切下来的芯片点亮都能跑。最终合格出厂的芯片占比,才是衡量一座晶圆厂真实产能和工艺壁垒的唯一标准。
如今,这套残酷的工业法则,被平移到了机器人数据赛道,不过衡量的是另一种维度的「提纯率」: 当你辛辛苦苦从真实物理世界采集了 1 万小时的数据,最终究竟有多少小时,能真正转化为大模型可以消化的有效经验?
得益于自建的工厂,Maxinsights 数据集良率已达 98%。
这或许才是精品 150 万小时数据的真正战略意义所在。它不仅仅是一个庞大的训练素材库,更是一个随着规模膨胀而越滚越强的超级反馈闭环,并由此形成一道越来越难复制的护城河。
1000 万的精品数据集
如今看来,精品 150 万小时只是一个序章。
Maxinsights 给自己定下的下一个目标,是积累 1000 万小时高质量、可直接用于模型训练的数据。随着数据飞轮持续转动,这个目标已经越来越近。
大模型时代,人类第一次发现,互联网不仅是一张信息网络,也是一座巨大的训练集。
Physical AI 没有这样一个现成的训练集。现实世界里的经验分散在人、机器、家庭、工厂和无数日常动作中。
Maxinsights 希望把这些从未被结构化记录的人类经验,变成 Physical AI 可以持续消费的数据基础设施。
在未来的规划中,这座基础设施还会变得更聪明、更广阔——
比如,通过视频理解和智能检索体系,把海量原始视频转化为可搜索、可组合的数据资产;与仿真数据结合,进一步拓宽训练数据的边界。
最后,它会更像一个物理经验引擎,能够持续理解真实世界、发现数据缺口,并不断生产机器人真正需要学习的物理经验。
热门跟贴