[首发于智驾最前沿微信公众号]在自动驾驶模块化时代,数据标注就是画框,也就是在图片上框住行人车辆,给点云套上立方体。
但画框只能告诉AI那里有什么,没法告诉AI接下来会发生什么。
一辆车是否在加速靠近,一个行人是否正打算横穿马路,这些动态信息在标注环节就被丢弃了。
端到端兴起后,标注的需求彻底变了。
模型不再需要框,而是需要人类司机的驾驶轨迹,也就是方向盘打了多少度、油门踩了多深。
同时,端到端模型需要海量覆盖各种场景的数据,而真实道路上的危险场景天然稀少。
行业开始意识到,必须有一套新的数据基础设施来解决这个问题,云端数据引擎的概念应运而生。
01
为什么需要一套数据引擎
云端数据引擎不是某个单一算法,而是一套部署在云端的自动化数据流水线,
其任务就是把车端回传的海量原始驾驶数据,自动转化成可以用来训练模型的高质量数据集。
腾讯数据闭环平台、华为乾崑WEWA架构的世界引擎、特斯拉的数据引擎,本质上都是这个概念的不同实现。
图片源自:网络
这套引擎可以将人力从繁重的重复劳动中解放出来。
传统人工标注一帧3D点云成本高达17元,单人每天只能完成3帧,50万帧数据需要850万元和16.7万人天,相当于100个人持续标注4.5年。
而引擎可以全自动完成标注流程,效率提升是几个数量级的。
特斯拉的4D自动标注系统在集群中运行12小时即可完成10000次行驶轨迹的标记,同样的工作量如果靠人工需要500万小时。
更重要的是,它改变了标注的思维方式。
传统标注是被动的,送过来什么就标什么,价值密度很低。
引擎则可以主动挖掘高价值场景。
从每天回传的海量数据里,它会自动筛选出窄路会车、突然窜出的行人这类困难片段,优先送入标注流水线。
理想汽车就已经部署了200多个数据触发条件,用来从15亿公里的驾驶数据中生产15到45秒的高价值视频片段。
这让有限的算力和存储资源都花在了刀刃上。
对于端到端模型来说,引擎还提供了一种传统标注做不到的能力。
它不再只标注单帧画面里的静态物体,而是离线重建整段视频的4D时空信息。
每个动态目标在连续数百帧中被赋予唯一ID,系统推算出它的精确运动轨迹和速度。
这相当于给模型提供的不再是照片,而是一段完整的影像资料,其中包含了时间维度上的全部变化。
特斯拉就采用多趟场景重建技术实现4D自动标注,能够获得伪真值,在很大程度上取代人工标注。
基于已标注的真实场景,引擎还可以自动调整光照、天气和背景,生成大量变种数据。
一个雨天夜晚的场景可以衍生出不同雨量、不同亮度、不同车流密度的数千个版本。
华为的世界引擎基于扩散生成模型,就能够将关键难例场景的生成密度提升1000倍。
这极大扩充了训练集的覆盖范围,让模型有机会在训练阶段就见到更多样的情况。
据商汤发布的报告,通过世界模型自动生成带有标注的图像与视频数据参与训练,可以为企业节省接近一半的数据成本,同时将数据准备效率提升约七成。
02
引擎是怎么工作的?
云端数据引擎由三个层面构成,各自承担不同的功能。
第一层解决的是数据筛选问题。
车队的每辆车每天回传大量数据,但大部分是重复的日常场景。
引擎在这一层运行场景理解模型,自动给每段视频打上语义标签(雨天、夜间、拥堵、无车道线等),然后通过主动学习算法计算每个片段的不确定性得分。
模型越搞不懂这个场景,优先级就越高。
有研究显示,基于不一致性的主动学习方法,用50%的标注数据就能达到和随机采样相同的检测精度。
只有高价值片段才会被送入下一环节。
这一步本质上是把数据的价值密度提上来,避免后面的计算资源浪费在平淡无奇的素材上。
图片源自:网络
第二层是自动标注的核心。
它调用云端的大模型,对筛选出的视频片段做联合处理。
摄像头拍摄的2D图像、激光雷达扫描的3D点云、车辆的IMU数据,先在统一的时空坐标系下对齐。
这一步要求很高,微秒级的时间戳和毫米级的空间坐标必须完全重合,对齐误差超过几厘米,后续标注的位置就会出现偏差。
Fusion4DAL提出了一种离线的多模态3D目标检测方法,通过虚拟点机制克服点云稀疏性问题,增强检测精度。
对齐之后,算法可一次性处理整段视频的所有帧,利用已知未来的信息来回溯修正当前帧中被遮挡物体的位置,这项技术叫作回标。
每个动态目标在数百帧中被持续追踪,系统输出带有完整运动轨迹的4D真值数据,整个流程不需要人工参与。
腾讯的4D动态标注大模型就支持多摄像头加激光雷达的特征融合和动态学习模型权重。
第三层做校验和扩展。
自动标注完成后系统会快速验证质量,置信度足够高的直接打包送入训练集群,存疑的则流转给人工专家做局部微调。
这种大模型自动标注加人工质检修正的模式,正在取代传统的纯人工标注。
此外,引擎可以基于已标注的真实场景生成大量变种数据,用较小的成本成倍扩充训练集的规模。
03
最后的话
云端数据引擎正在改变自动驾驶研发的成本结构。
搭建这样一套引擎的初期投入很大,需要数千张GPU和复杂的工程系统,但当车队规模足够大之后,边际成本会急剧下降。
这也是头部玩家愿意重金投入的原因,它不仅是技术能力,更是规模效应的体现。
但从市场角度看,各家在这个方向上的进展参差不齐。
真正决定差距的恐怕不在模型架构的选择上,而在数据基础设施的深度上。
世界模型也好,端到端模型也好,没有高质量的4D训练数据,预测能力就无从谈起。
而数据引擎本身的质量,又取决于自动标注算法的精度和覆盖率。
这是一个互相咬合的系统,任何一个环节的短板都会成为瓶颈。
图片源自:网络
另外有一个值得注意的问题。
用来生成长尾场景的生成式模型,它的缺陷恰恰最容易出现在长尾和分布外的区域。
场景越稀缺,生成的内容就越容易出现物理不一致和目标漂移。
行业普遍认为,仅靠数据闭环解决不了所有问题,主要瓶颈就在于长尾场景的收敛。
世界模型既是解决数据稀缺问题的工具,它本身也面临数据稀缺的问题。
这个矛盾短期内还看不到完美的解决方案,更可能会成为制约数据引擎效果上限的关键因素。
热门跟贴