打开网易新闻 查看精彩图片

一个会说话的AI,和一个能自己动手干活的AI,中间到底隔着多远?

9月3日,OpenAI正式发布GPT-6 Astra,答案被又往前推了一大步。

它在ARC-AGI-3上拿到99.9%的成绩,这项测试考验的不是背知识点,而是AI能不能在完全陌生的环境里自己摸索规则、自己规划行动。

更扎眼的是另一个数字:在96%的关卡里,Astra的行动效率达到甚至超过了人类基准。

一天之后,Robocurve把Astra接进了一台真实的双臂机器人,让它去做"抓起积木放进碗里"这件事。

20次里成功19次,几乎没有翻车。

一、从答题到动手:AI正在跨过数字世界的边界

打开网易新闻 查看精彩图片

这两个结果放在一起看,释放的信号很清楚:最前沿的大模型,正在把能力边界从屏幕后面,往物理世界里继续推。

过去AI回答问题,靠的是理解文字、组织语言。

现在AI要完成一个抓取任务,得先看懂环境、想清楚下一步、再真正把动作做出来,这是完全不同量级的挑战。

而当模型开始要"动手"而不只是"动嘴",它吃的数据也必须跟着变。

大模型当年靠互联网文本完成了规模化训练,可机器人长期缺的正是这种量级的数据。

真机数据采集又贵又慢,还往往只能绑定某一种特定的机器人本体,换一台机器就得重新来过。

二、机器人的新燃料:人类的第一视角经验

打开网易新闻 查看精彩图片

今年8月,Dyna Robotics把这个瓶颈撬开了一条缝。

他们第一次把"人类经验数据"——也就是第一人称视角拍摄的egocentric data——的训练规模推到了100万小时。

从1000小时一路加到100万小时,Dyna-2的预测表现始终在往上走,看不出明显的天花板。

更值得注意的是,在预训练阶段完全没见过的机器人任务上,Dyna-2依然展现出更强的泛化能力,这说明它学到的不只是套路,而是某种更底层的经验规律。

几乎同一时间,Genesis AI推出了自己的首个机器人基础模型GENE-26.5,同样选择了egocentric data这条路,把真实人类活动里的视觉、动作和交互过程,统统喂进了模型训练。

这些实践共同指向一件事:机器人训练,正在开始大规模吸收人类真实活动本身,这是一条过去被严重低估的Scaling轴。

《连线》杂志把这股势头称为"egocentric data boom"。

越来越多机器人公司开始让采集员戴上摄像头,批量生产第一人称视角视频,甚至有投资人预计,头部公司未来几年会买下数亿小时的这类数据。

三、淘金热里,谁在卖"铲子"

数据来源找到了,但一个更现实的问题随之而来:谁能把这些原始视频,持续、高效地变成模型真正能用的训练数据?

采集只是第一步,海量的第一视角视频要经过清洗、标注、结构化处理,才能变成机器人模型吃得下的"燃料",这中间的工程量并不比采集本身轻松。

在Dyna-2和GENE-26.5这两个亮眼成绩的背后,一个共同的角色浮出水面——数据处理服务商Maxinsights,扮演的正是这场淘金热里卖"铲子"的角色。

历史总是押着相似的韵脚,淘金热里最先赚到钱的往往不是淘金的人,而是卖铲子、卖牛仔裤的人。

这一次的"铲子",换成了能把人类经验批量转化成机器人可用数据的处理能力。

随着Astra这样的前沿模型不断把AI推向物理世界,谁能稳定供应高质量的人类经验数据,谁可能就握住了机器人这条赛道下半场的关键筹码。