当下不缺模型公司,缺少数据加工的公司。
作者 | 田 哲
编辑 | 李雨晨
过去一年,“物理AI”几乎成了自动驾驶、车企共同争夺的下一张船票。
世界模型、具身大模型、机器人数据……众多公司从不同切入口布局物理AI,试图成为新风口之下的主角,相比之下,如祺出行选择了一条不那么显眼的路径,不自己训练大模型,而是尝试成为模型背后的数据基础设施。
实际上,如祺出行在2023年就开始思考,除了提供包括Robotaxi等出行服务,一家出行平台还能在AI产业里扮演什么角色。随后两年,如祺出行逐步完成数据闭环,一端连接驾驶员、Robotaxi和城市道路,另一端服务自动驾驶模型的训练与迭代。
而具身智能的兴起,让这套能力有了新的用武之地。
在如祺出行COO韩锋看来,自动驾驶与智能机器人需要的数据并不完全相同,因为前者主要在二维道路空间中完成感知、决策和运动,机器人则要进入三维空间,处理抓取、搬运和精细操作。但两者背后的数据处理流程高度相似,从采集、预处理到标注、质检和导出,底层工具链可以复用。
然而,由于真实数据采集成本高昂,且周期漫长,越来越多智驾和具身智能公司借助世界模型和仿真平台生成合成数据,补充真实数据不足,以提升模型训练效率。
但在韩锋看来,世界模型能力越强,真实数据的重要性并不会因此降低。合成数据能够以真实长尾案例为基础,扩展难以反复采集的危险、临界和复杂交通场景;真实场景数据则能持续记录交通参与者不可预设的行为、道路环境的变化和传感器的物理响应,帮助发现尚未被识别的问题,并为合成结果提供校准和验证依据。两者共同形成“真实数据发现与验证、合成数据定向扩展”的互补闭环。
目前,如祺出行试图依靠投入常态化出行服务的数据采集车、Robotaxi和线下运维网络,以较低成本持续获得真实、连续且规模化的数据,再通过已经搭建的数据闭环,将其转化为自动驾驶、世界模型和具身智能公司可以直接使用的训练材料。
这可能不是物理AI浪潮中最性感的故事,却更接近产业落地。当今并不稀缺模型公司,而是缺少能长期通过真实场景稳定获得数据,并把原始数据加工成可用资产的组织能力。
如果这套能力能够持续扩展,如祺出行在AI产业中的角色也会随之发生变化,正如当下许多公司撕下原有标签,强调“物理AI”属性。
但韩锋表示,三年后,他希望外界仍然把如祺出行看作一家出行服务公司,但同时也把它视为AI数据生态中的重要基础设施。
以下是新智驾与如祺出行COO韩锋的对话,内容经编辑整理:
PART 1
数据服务没有神秘技术 门槛来自长期沉淀的体系化能力
新智驾:如祺的数据业务是什么时候开始搭起来的?当时为什么会选择这个方向?
韩锋:2023年,我们推出智驾数据工具链,算是布局AI数据服务的开始,把日常运营产生的驾驶员驾驶行为、道路路况、路网信息等数据回流,用来支持自动驾驶算法迭代。
过去几年,我们主要在搭一整套数据闭环,从数据采集、清洗处理、标注加工,到模型效果评测,把整条工具链逐渐建立起来。
到了2026年,具身智能发展很快。我们再看这套体系,发现底层工具其实具有很强的通用性。
不管是自动驾驶还是具身智能,都离不开数据导入、处理、标注、质检、评测这些环节,变化的是具体的数据形态和任务,但底层的数据工程体系有很多可以复用。
所以我们不是突然转去做具身,而是把过去在智驾里面建立的数据能力继续往外延伸。
新智驾:现在大模型、世界模型都很热,为什么如祺出行不自己做模型?
韩锋:因为这不是我们的核心优势。
我们的优势还是场景和数据。如祺出行有可以直接投入到出行服务的数据采集车、Robotaxi,也有线下服务和运维网络。大量车辆每天就在真实社会环境里运行,可以持续产生真实数据。
所以我们更愿意围绕数据生态做这件事,而不是看到一个技术方向很热,就自己去做一个大模型或者世界模型。关键还是看自己的优势在哪里。
新智驾:大型自动驾驶公司、智能机器人公司通常都有自己的算法和数据闭环。既然有能力自建,为什么还需要把一部分数据业务交给如祺出行?
韩锋:因为客户真正需要的不是简单拿到一批数据,他需要的是可以直接进入训练流程的低成本、高质量数据,还包括确定性的交付产能和工程效率。
即便一家客户已经有很强的算法和训练能力,如果想大规模做数据采集、合规治理、标注、质检,还是需要持续投入设备、人员和运营资源,这是一个比较重资产、重运营的过程,也会占用很多研发人员的时间。
我们提供的是基于真实场景的数据获取能力,再按照客户的训练要求,把数据稳定、高效地处理和交付出去,客户就可以把更多精力集中在模型和算法迭代本身。
新智驾:所以客户最后真正愿意为什么付钱?
韩锋:首先是场景是不是他需要的,其次是数据质量能不能达到要求,然后是你能不能稳定、高效地交付。抛开这些单纯谈成本其实没有意义。哪怕一批数据是免费的,如果它对模型训练没有价值,对客户来说还是没用。
新智驾:有没有一个具体项目,能说明客户购买的这种“工程效率”到底是什么?
韩锋:我们服务过一家2016年成立的头部自动驾驶公司。过去两年,他们研发投入持续增加,对数据标注的需求增长得非常快。
我们的做法不是简单接到需求以后马上开始标,而是先根据客户的数据规范,把复杂的标注任务结构化,把任务本身做得更容易生产。
之后再给不同的数据处理任务匹配相应的资源,整个过程进行数字化管理,以天为单位持续交付。
另外,我们还会提前介入客户的数据标注工作。
因为客户的需求会波动,如果等需求突然上来了再开始组织产能,中间会有一个比较长的爬坡过程。提前介入之后,可以缩短这段时间。
最后客户得到的不只是标完的一批数据,而是比较稳定的数据产能,能够跟上他的模型迭代节奏。
新智驾:数据采集、标注本身看起来并没有特别高的技术门槛,如祺出行认为这门生意真正难复制的地方是什么?
韩锋:客观来说,这套业务不存在特别高的、学术意义上的单点技术壁垒。真正的门槛是长期沉淀。
首先是怎么采。传感器、车载设备部署、怎么采集驾驶员在真实场景里的操作,这些东西看起来不复杂,但真的大规模做起来,有很多细节都是项目一点点磨出来的。
第二是数据处理工具链。我们现在可以从采集、清洗、标注、评测,一直到格式适配和客户交付。
不同客户的数据格式、传感器标准、模型训练要求都不一样,真正做业务的时候,必须能够快速适配。
第三是这些能力会随着客户的反馈不断变化。客户会告诉你什么数据对模型有效、哪些地方还有问题,然后这些反馈又会反过来改变我们的采集方法、处理算法和工具链。
所以真正的门槛并不是某一个功能,而是整套体系长期迭代的过程。
新智驾:现在这套体系里,哪一个环节做得最成熟?
韩锋:数据标注目前是成熟度比较高、自动化程度也比较高的环节。
刚开始服务客户时,新客户的数据规范、新的传感器标准,我们也需要比较长的磨合。适配一个全新的客户,可能需要一年多,才能逐渐做到比较标准化、自动化地交付。
现在因为底层工具和流程逐渐成熟,再面对一个新客户时,过去积累下来的很多东西都可以复用,适配周期会明显缩短。
新智驾:数据服务天然定制化程度很高。怎么避免最后变成一家依赖不断增加人力的数据标注公司?
韩锋:我们肯定不希望业务增长多少,人员规模就跟着同比例增长。
长期还是要把不同项目里反复出现的能力抽出来,变成自动化工具和标准化的平台能力。客户的模型、数据格式、应用场景不同,所以一定会长期存在定制化需求。
但定制和标准化并不矛盾。关键是每做完一个项目以后,有多少能力能够沉淀下来,在下一次项目里直接复用,而不是每次都重新从零开始。
新智驾:很多公司也会讲“数据飞轮”。如祺出行所说的飞轮,和普通项目做多了以后积累经验,有什么区别?
韩锋:普通项目积累的更多是交付经验。
我们希望形成的是“真实业务场景、合规数据源、全栈AI数据能力”三个东西一起增长。
客户拿数据训练以后,会暴露新的模型问题。这些问题反馈回来,我们可以通过现有的采集网络,再补充相应的真实数据,经过处理之后重新交给客户。这样形成的是数据、模型和问题之间不断循环。
目前复购客户已经占到一定比例,具体数字不方便披露,但复购率已经是内部一个核心考核指标。
PART 2
Robotaxi和具身智能机器人复用的是数据基础设施
新智驾:现在如祺出行开始把数据能力往具身智能延伸,Robotaxi的数据真的能拿来训练具身智能机器人吗?
韩锋:只能部分复用。
这个问题要分成两个层面:一个是数据本身,一个是数据工具链。
数据本身既有相通之处,但同时也有差别。自动驾驶数据本身很大一部分是感知数据,它可以支撑智能机器人完成环境感知能力训练。但开车本质上还是一个相对统一的任务,而具身智能进入物流,可能要搬东西;进入商超,要整理货架;进入流水线,又涉及大量精细操作。它需要机械臂操作、运动轨迹、精细动作等操控类数据,这部分需要新的数据来源。
新智驾:所以真正可以复用的是什么?
韩锋:下面的数据基础设施。
数据导入、预处理、清洗、质检、导出,包括合规治理,这些底层逻辑其实是相通的。
当然,进入具身智能以后,我们也需要针对三维空间、精细动作标注这些新需求增加一些能力,但整个大的数据基础设施和工具链框架,不需要重新从零搭一次。
新智驾:机器人未来会进入工厂、物流、商超甚至家庭。如祺出行为什么第一步选择车后服务,而不是直接进入更大的场景?
韩锋:我们选一个场景主要看几个条件。
第一,有没有真实的业务需求;第二,我们能不能持续组织数据采集;第三,它跟现有业务能不能形成协同。从这个角度看,车后服务是比较合适的。
如祺出行本身有面向传统出行服务的车服,也在围绕Robotaxi建设线下运维网络。车辆内外清洁、外观检测、充电插拔,这些都是车后服务里真实存在的操作,也都是具身智能机器人未来可能承担的任务。
所以我们本身就有这些真实场景,可以持续组织数据采集,而不是为了采数据专门搭一个实验环境。
2026年6月,我们也推出了具身智能数据平台,处理Ego-centric第一人称操作视频,包括数据导入、AI预处理、动作标注、多级质检,再到标准化格式导出。现在是在已有场景里先把这套能力做起来。
新智驾:如祺出行每天可以产生大量真实数据,但这些数据里到底有多少真正有价值?
韩锋:很难给一个统一比例,因为数据的有效性是相对的。
比如一家已经做了很多年自动驾驶的公司,简单、常见的道路场景它可能早就不缺了。对它来说,这些数据的价值就比较低,它现在更需要的可能是急刹、复杂路况、极端长尾场景,但另一家公司可能还处在不同阶段,需要的又是另外一类数据。
所以同一份数据放到不同模型、不同客户、不同研发阶段,价值是不一样的。
当然,也有一些很明确没有价值的数据。比如激光雷达打到十几层、二十层楼高的位置,对地面自动驾驶基本没有用,这种我们在清洗阶段就直接去掉,不会再进入后面的流程。
新智驾:除了价格,客户选择数据时真正看什么?
韩锋:质量、真实性、场景的稀缺性,以及数据是不是能够持续、大规模地产生。
成本当然重要,但不是唯一指标。比如自动驾驶,我们的车辆每天都在真实城市里运营,所以采到的交通场景不是人为布置的,而且它不是采几天就停止,而是车辆每天都在运行,能够持续形成数据流。
具身智能里面,真实场景的门槛可能更高。
一家机器人公司想进入真正的工业生产线采数据,并没有那么容易。制造企业会考虑生产安全,也会考虑数据泄露,不会随便让一个外部机器人和团队进入产线。
所以真正能够进入这些场景,本身就是一个门槛。数据的价值最后不是看有多少TB,而是它来自什么地方,是不是模型真正需要的东西。
PART 3
合成数据越强重复采集的常规数据越容易贬值
新智驾:现在世界模型越来越强,合成数据也越来越多。如果以后大量道路和操作数据都能生成,真实数据究竟会越来越值钱,还是被压价?
韩锋:未来最可能被替代或者被压价的,是为了增加数量而反复采集的常规数据,不是真实数据本身。合成数据特别适合扩展已经知道的问题。
比如真实世界出现一个很危险、非常少见的长尾场景,你不可能让车辆在现实里面重复跑一万次。
这个时候可以以真实案例为基础,再用合成数据把它扩展出来。但是,真实世界还有一个合成数据很难替代的作用,就是发现原来不知道的问题。
真实交通参与者会有很多不可预设的行为,道路环境一直在变化,真实传感器也存在自己的物理响应。这些未知问题,没有办法完全靠模型自己生成,再由模型自己证明它是对的。
所以我认为,真实数据更重要的是发现问题和验证,合成数据负责对已经发现的问题做定向扩展。两者相辅相成,都是如祺数据要持续积累发展的重要资产。目前,如祺相关数据资产已经覆盖感知数据、行为数据、合成数据和多模态训练数据集四大类。
新智驾:这也是为什么您认为世界模型越强,反而越需要真实数据?
韩锋:对。
世界模型要学习真实世界的物理规律,还要根据现在的状态预测未来会发生什么。
比如自动驾驶做了一个刹车或者转向,未来几帧环境会怎么变化,具身智能机器人做了一个动作以后,物体会怎么变化。模型想把这种预测做得越来越准确,还是需要真实世界的数据去训练、校准和验证。
合成数据可以降低基础训练成本,也可以补充很多场景,但今天这个技术范式下,做到后面的微调和真实场景验证,还是离不开真实数据。
新智驾:对具身智能来说,这个问题是不是比自动驾驶更严重?
韩锋:具身智能的数据问题会更复杂,它有一个“鸡生蛋、蛋生鸡”的问题。
具身智能机器人如果还没有进入真实场景,就很难得到大量真实操作数据,但没有这些数据,机器人能力又很难训练成熟,再真正进入这些场景。
更何况,机器人面对的任务种类比开车更多,物流、商超、工厂,每个场景都有不同的动作和操作需求,所以真实生产和服务场景,对具身智能的数据训练会非常重要。
新智驾:现在数据业务更多是在利用如祺出行已有车辆和场景做附加变现,还是已经成为一门独立业务?
韩锋:它从一开始就是长期投入的业务,而不是出行业务的附加变现。
现在数据业务已经有独立团队、预算、收入目标和客户拓展体系,包括自己的销售、产品、算法和交付团队,跟包括Robotaxi等在内的出行服务之间会共享一些底层资源。
出行业务给数据业务提供真实场景,数据能力也会反过来支持Robotaxi技术和运营迭代。
新智驾:收入现在做到什么规模?
韩锋:过去几年增长比较快。
2024年上半年,AI数据服务收入同比增长175.8%;2025年上半年同比增长207.0%;2026年上半年,同比增长274.4%,半年收入已经超过1亿元。
新智驾:客户还是主要来自广汽、腾讯这样的股东体系吗?
韩锋:具体客户名单和订单结构,因为协议不能披露。
但目前服务的客户已经来自多个行业,包括自动驾驶、互联网、人工智能、消费电子。过去在汽车和智驾产业里搭起来的数据能力,并不是只能用在汽车,采集、合规治理、数据处理、标注、质检、交付这些底层能力,本身可以延伸到其他AI场景。
新智驾:如果三年以后再来看,用哪些指标能判断这项业务真正跑通了?
韩锋:首先还是收入,第二是客户合作能不能持续,包括复购,第三是标准化能力和交付效率有没有继续提高。
即使以后可能还会有定制项目,也不能单纯因为有定制就认为这个业务没有跑通。
AI数据本身就存在客户差异。真正要看的是,每做完一个客户以后,有没有沉淀出可以复用的工具和流程,下一次交付是不是能够更快、成本更低。
自动驾驶行业动态,雷峰网《新智驾》将持续关注,欢迎添加作者微信:tz--hh,获取更多信息。
热门跟贴