最近我发现了一个有意思的事。
今年上半年,具身智能数据这条赛道,一下冒出来一堆新团队。
背景也出奇地像:CEO是技术出身,拉几个人,搞几台相机,快速搓个原型设备,甚至不一定有机器人本体,就可以开始对外接单、讲故事,或者拉着地方去搞数采中心。
但对于行业来说,问题在于,具身智能机器人行业如何找到壁垒和竞争力?如何找到具身智能真正的商业化价值,而不是虚构数据订单?
本周四,我参加了觅蜂科技的“觅蜂派”新品活动,觅蜂科技董事长、CEO姚卯青再次与媒体们对话了一个多小时。
2024年,姚卯青牵头建成行业规模最大、场景最丰富的数采超级工厂之一,并开源全球首个基于全域真实场景的百万真机数据集AgiBot World。
到了2026年,数据开始占据姚卯青更多精力。2月份上海觅蜂具身智能科技有限公司成立,姚卯青担任一把手。
姚院在行业的口碑,已经不用我再去形容了,他见证了国内自动驾驶、具身智能行业的跌宕起伏。
所以,姚卯青的真话,对于行业来说实属难得。
听完,我得说句自己的感受:这些具身智能公司里面,大部分可能熬不到明年。不是技术不行,而是没有真正了解到具身智能数据行业。
你看啊,具身智能数据,听着是一个轻资产、软件活,实际上是个重资产生意,模拟仿真、真实数采。
姚卯青给我们算了笔账:今年他们要应对1000万小时的数据,背后是大几个亿的固定资产,从设备制造、人员雇佣,到云端存储和算力,一环都省不掉。
“觅蜂派以及觅蜂整个公司还是以需求为主导驱动的,我们是以销定产,我收到什么需求再去采集,而不是我现在盲目采集,要很多人、很多场景,你要精确去对应你的需求。”
他用了个词,叫“六边形战士”。
翻译一下就是:光会用相机采集数据、找个集中式数采拉个数据订单、买点数据做模型,只做这些,在具身智能这行连入场券都算不上。
具身智能数据类型的企业是需要庞大的资源和重资产能力。
因此,觅蜂科技做的事情其实非常简单:构建物理AI数据基础设施,让高质量物理AI数据像水电一样即取即用。更关键的是,用更多的真实物理AI数据做到原生通用具身智能大脑,实现庞大的物理AI底座。
如果说,AI算力和底层基础设施的英伟达是AI赛道的“卖水人”,那么,觅蜂科技就是做物理AI赛道的“卖水人”,当然还是更有经验的“炼金术”。
9月23日,觅蜂科技发布数据众包产品“觅蜂派”,宝妈、店员、手艺人都可以戴上觅蜂科技的MEgo采集设备,完成他们的日常工作,这些任务通过设备的传输,都可以变成机器人训练需要的数据。
姚卯青在发布会上表示:在为期1个月的内测期间,觅蜂派表现超预期,注册用户数达2万人,采集提交总量为1.3万份。
目前,觅蜂派的任务覆盖22大类场景、5000多个任务和50000多个真实环境,具体场景包括物流、仓储、住宿服务、教育、养老照护、餐饮、零售、公共服务、办公、汽车服务、医疗、建筑施工、交通出行、农业生产、文旅等。
觅蜂科技表示,面向未来两年,该公司建设百万级日活采集网络,打造全球领先的物理AI数据供给平台。
觅蜂派APP给予用户的报酬也不同,例如快递拆封是30元/小时,其他像宠物喂养、泡茶、厨房清洁则是每小时20元。
发布会现场公布的一份众包数采员的报酬榜单显示:在一个月的内测时间里,数采员最多可以赚到 5000 多元。
事实上,如果说数采工厂做的很多都很demo化、很多数据无法真正做到模型里面,觅蜂想做的则是把无本体数据的“质量变高”,扩大数据采集范围,用更低的成本,获取与人类相同的真实物理AI数据。
当然,想做这事的并非只有觅蜂一家,先行者是海外头部人形机器人企业Figure AI对外推出的Index平台。
Figure的做法也是类似的:普通用户录制现实生活中的操作流程,提交平台之后就可以为机器人模型提供训练素材,并获得对应的劳务回报。
因此,觅蜂派则被视为“中国版Index”。
但不同之处在于,Index采集的数据主要是自用,而觅蜂派面向的是更广泛的行业需求——服务不同模型厂商、机器人企业和数据采购方,根据客户需求组织数据生产,并将处理后的数据作为服务对外交付。
当然,姚卯青对智能纪元AGI表示,这个数据如何交付和销售,依然会分门别类提供,但对于在AGIBOT系列的世界模型和具身智能模型中有多少比例交付,这事至今还很难量化。
换句话说,觅蜂众包这件事才刚刚开始,一步一个脚印先跑起来,再看商业飞轮如何运转。
姚卯青强调:“今年头部具身模型企业对于Ego(以第一人称的采集)数据量的需求已经达到了千万小时量级,市场需求非常广阔。”
今年我感受到一件事:具身智能的数据不在于多,也不在于几百万小时,而是能否获取高质量的数据内容,数据和模型能否真实部署到物理场景中,能否形成泛化和通用性。
物理AI和具身智能机器人的竞争很大程度上已经演变为数据供给能力的比拼。
这些目前还是难解的问题。
现在具身智能技术的问题,不仅仅是数据,触觉、算力、灵巧手、场景、客户等都是当前通用具身智能人形机器人面临的新挑战。
当然,我们也相信,当数据瓶颈逐步被消解,机器人才能真正读懂这个纷繁复杂的现实物理世界。
但这个路程还有很长时间,背后也需要庞大的算力、数采规模、成本的支撑。
但现在国内具身智能行业属于“小而散”,小公司偏多,各种路线、背景的人都加入其中,很多公司都在做具身数采、运营数采、做具身智能、做世界模型、做零部件、做灵巧手、做渠道,而这种小、散且竞争的状态,无法真正形成一家英伟达、OpenAI这类的公司,甚至是π的十分之一都不到。
如何让国内具身智能行业拥有“高质量”数据,让机器人本体拥有聪明、开源的大脑,距离这个目标还有很长的路要走。
最新消息是,成立7个月的觅蜂科技,最新估值已超过100亿元。这足以看出觅蜂在具身智能行业中的优质地位。
在 AI 工具普遍走向“大而全”的当下,觅蜂选择了一条相反的路,不做横向铺开,只在垂直领域纵深打透。这种聚焦策略,反而让它在细分赛道里建立起了难以被通用型产品替代的壁垒。
以下是觅蜂科技董事长兼CEO姚卯青的对话摘录(有删减):
问:目前行业内做具身数据采集企业已经有近百家了,也有像觅蜂派头部玩家,初创公司也在陆续加入,我想问一下您,怎么看待这个赛道真正的门槛是什么?未来各类玩家,长期会走向一个什么样的形态?您是否会担心未来出现数据结构性过剩问题?
姚卯青:从今年上半年年初开始,确实伴随着需求的增长,有很多初创团队陆续出现,但就是我们观察下来,有几个特点。
普遍来讲,以技术背景创业为主,会在早期快速的做一些原型数采设备,以相机为主的比较快的原型设备,但是这个行业如果你真正要进入到规模化以及盈利这么一个状态,其实是非常看重您的运营能力,运营能力其实包括几个点:
1、是否能快速去规模化运营人、场景,满足市场的需求,因为我们刚刚说了像觅蜂派以及觅蜂整个公司还是以需求为主导驱动的,我们是以销定产,我收到什么需求再去采集,而不是我现在盲目采集,要很多人、很多场景,你要精确去对应你的需求。
2、在运营过程中去做这些成本优化、效率的提升、商业上的一些创新,这其实是对于具身数据采集在产品和技术之外,非常重要的一个环节;同时它还是一个需要较多的资金前期去投入的行业,无论是采集设备的生产制造、人员的雇佣、费用的结算再到数据后面处理的整套,云端的基础设施建设,海量的存储、计算这些设备,我们其实都应对今年1000万小时的数据,是大几个亿固定资产投入,不太适合几个人出来创业,融了几百万、一千万就能把这个事规模干起来的。
所以,会不会出现行业整合,我觉得这个应该是必然的,因为它就是一个六边形战士,又要技术很好,做出来的产品还能在技术上领先供应链、生产制造,从保供、产能、BOM成本再到质量,你是按照这种非常高的标准,消费电子以上的标准去构建,同时你还要重资产投这些算力存储。
我认为,后面逐步发展的话还是会出现一些行业分工,不会说大家都是干整个链条,端到端形式,可能有些产品它如果真的能进入到量产,也会提供一些数据采集的能力,但可能运营又是通过其他的公司、其他团队使用他们的设备去完成,最后可能还有一些公司,一些环节是做数据的后处理加工、分发这些,偏技术型的后端服务,应该是会出现整合的趋势。
问:在已有的两万台设备和百万小时数据后,为什么现在要进入众包?还是真正要突破的是数量、场景多样性还是有效数据率呢?
姚卯青:百万小时这个量级,放到2026年底已经远远满足不了市场对数据的需求了。大家可以看到,不少做单一大模型和具身智能的公司,数据量都已经到了百万小时级别——这就是我们要开启数据获取第二增长曲线的原因。
而且,刚才我也提到过,我们不是在简单地堆量,而是越来越往细分赛道、专业技能方向去深耕。
比如,过去大家都在做家庭场景,都在叠衣服,叠衣服的数据早就泛滥了,根本不需要再采。现在大家需要的是更专业的技能——哪怕是修水管、修车、理发、做美甲,这些都需要一个个去点亮、解锁。靠我们自己集中式地打电话去跟人谈"能不能让我们采集",肯定又慢又难,效率很低。所以我们希望通过众包的方式,更灵活、更便利地进入这些场景。
很多行业的发展都证明了:全民参与,最后出来的质量才是最高的。就像自媒体一样,每个人上传自己的生活片段,才是最精彩、质量最高的。数据这件事也是一样,你集中去搞,当然也能覆盖一些场景,但没法充分释放各行各业、个体最精彩的职业技能。
您第二个问题是说,真正要突破的是数量还是场景丰富度?现阶段,场景丰富度肯定是最关键的。因为质量是基础,在前面百万小时的积累过程中,我们已经打磨得相对成熟了。现在不管是MEgo硬件设备采回来的数据,无论是原来的集中式采集,还是现在的分布式采,上到MEgo Engine之后,整个处理流程都是标准化的,基础质量是可以保证的。
问:觅蜂在真机、无本体、仿真方面都有布局。您认为现在具身数据的采集和处理技术路线有没有收敛?收敛到了什么程度?另外,对于具身数据行业来说,除了规模需要突破,还有哪些问题是比较迫切需要解决的?
姚卯青:采集路线短期来看已经比较收敛了,我们现在就提供这几个 SKU 品类。不过需求量确实会随时间有所波动。
比如 UMI 类数据出现得比较早,但上半年 ego 数据的需求量突然激增,大家都对它非常感兴趣。而最近一段时间,反而是 UMI 类数据和真机类数据的需求在快速上升,尤其是很多客户都在试图获取 UMI 类数据,我们观察到了这个趋势。
我们还发现一个现象:头部客户很多都是独家定点给单一供应商。因为数据量一大,质量参差不齐会让他们非常痛苦,后端管线要做清洗、格式转换,好坏数据混在一起,模型是训不出好效果的。所以客户经过一段时间的试用评估之后,会重点转向集中、甚至单一的供应商来提供数据。这背后其实比拼的就是供应商本身的技术质量能力,以及运营端快速响应、交付的能力。
刚才反复提到,现在数据量已经到了百万、千万小时级别,市面上几乎没有什么初创团队能拿得出来。你给他一个一千小时的订单让他交,他可能交一个月都交不出来。手里就几套手搓的 3D 打印设备,也没有运营资源,再怎么赶也需要很长时间。但头部客户一周就要交五万、十万的量,没有足够的资源支撑根本做不到。所以我觉得,接下来质量和运营都会是核心竞争力。
问:未来数据销售客户画像大概会是什么样子的?还有哪类厂商可能会成为目标客户?Ego数据是不是比真机数据提升效果更明显?
姚卯青:客户目前可以归纳成三类:
第一类是具身智能公司。这类公司既有本体也有算法,希望做自己的基座模型。
第二类是世界模型公司。今年涌现出很多做世界模型的创业团队,他们自己不做本体,短期也没有具体的落地应用,但一直在做具身相关的世界模型,会用到比较多的无本体数据来做预训练。
第三类是大模型厂商。大模型原来在互联网上的数据已经消耗得差不多了,要进一步提升模型本身的智能能力,就必须进入真实世界,去获取闭环决策类的数据。大家也看到最近有些头部大模型的新版本,已经具备了在物理世界里做决策和规划的能力——这正是因为他们已经开始把这些数据训进了多模态基模的能力里面。
第二个问题,Ego数据是否比真机数据有提升,其实要看你的目标是什么。
如果是要做一个任务Demo,那真机数据肯定是效果最立竿见影的。你用这台Demo机器在具体任务里采数据,直接拿去训练,相当于定向拟合这个场景,效果肯定是最快最明显的。
一般来讲,Ego数据不是为某个任务Demo做定向优化用的。它是给刚才提到的那两类客户——大模型公司、世界模型公司——在早期预训练阶段,用来提升基础模型的泛化能力,也就是Zero shot零样本通用能力的。它的特点是:数据量少的时候,你根本发现不了它到底有多大帮助;要积累到比较大的规模之后,才能逐步看到一些激活、涌现的能力。如果是小模型、小数据量、做单一场景,那并不是它最适用的场景;反而是我们提到的那些大模型公司、世界模型公司的预训练,才能真正用出效果。
我们自己在和用户交流的过程中也能明显看到:当你把不同数量级的Ego真机数据、或者Ego数据加进去之后,模型在新任务、新环境上的Zero shot零样本能力,确实有明显的解锁和提升。
问:目前这套数据从众包到后续咱们团队处理的流程是否能够cover成本?
姚卯青:众包能不能商业上盈利,这是可以的,两方面:
1、通过众包平台,非常好优化了它在采集这侧的人力成本,大家可以看到它的概念,不是说我们专门雇一个人去采集,而是你在正常日常生活或者工作的过程中,顺便把这个东西采了,所以是一种额外赚了一点补贴的概念,它跟你专职雇人肯定有优势。
2、后处理这块,我们现在也是通过很多方式在优化它的成本,包括我们的很多存储、计算都是用了一些自己建的数据中心资源,相比其他一些运营也有一定优化,我们整个从标注到切分到空间的一些信息提取等,所有模型都是自研的,而且都在做快速的飞轮迭代。
我们数据量越大,模型效果越好,而且模型效果好,整个人工占比就会更低,自动化程度更高,所以整个下来的话,我们相比于市面上产品数据最终售价,即使单次出售也都已经有一个比较好的毛利率。
热门跟贴