打开网易新闻 查看精彩图片

ROBOT INDUSTRY

矿山无人化是物理AI在工业场景中最复杂的落地实践之一,真实场景数据稀缺、采集成本高昂,算法迭代一度依赖现场调试。中科慧拓(北京)科技有限公司(以下简称“中科慧拓”)给出的答案是构建一套虚实平行的数据底座,以10%的真实数据为物理锚点,以85%的虚拟泛化数据为主体,以5%的人工作业数据为补充,搭起一座可以规模化生产数据的虚拟矿山

近年来,AI行业的叙事重心发生了明显迁移:从压缩文本的语言模型,转向理解现实世界的物理AI。英伟达用世界模型统一机器人、数字孪生与自动驾驶,小鹏、理想、Momenta先后把"物理AI"写进公司战略,行业共识逐渐清晰——下一阶段的大模型,要学的不是怎么对话,而是明白世界如何运转。

然而,物理AI的训练数据从哪里来?

文本和代码都可以抓取,但物理世界的运行规律无法从互联网语料中习得。例如,一辆重载矿卡在-30℃的雪原上编队行驶,轮胎压过结冰路面的附着系数变化、转向油压在低温下的响应迟滞、多车在交汇路口的博弈决策,这些数据不存在于任何公开数据集,只能在真实场景中跑出来,或在高仿真训练环境中练出来。

打开网易新闻 查看精彩图片

图1 : 中科慧拓无人运输仿真系统重载编组运行测试(雾天)

前不久,中科慧拓对外披露了其矿山多模态数据平台的完整架构,为行业长期面临的“数据荒”难题给出了系统性解答:一套以真实生产数据为基础、以虚拟泛化数据为主体、以人工作业数据为补充的矿山数据底座,以及支撑这套底座运转的平行矿山技术体系。

要理解这套数据底座的价值,首先要理解矿山数据的特殊性。

1

矿山是大模型难以应对的动态场景

打开网易新闻 查看精彩图片

所有正在推进无人化的工业场景里中,矿山是一个常常被低估难度的存在。

日常道路上的自动驾驶有相对静态的世界模型:路面是修好的,通行规则是成文的,红绿灯位置是固定的。然而,矿山没有这些前提。采场每天都在向前推进,今天的工作面在明天就会变成排土场;路面被重载矿卡反复碾压,车辙深度持续变化;装卸区、挡墙、破碎站的位置随生产计划持续调整。一辆矿卡面对的"道路",是一个每周都在重新生成的动态环境。

图2 : 中科慧拓参与建设的华能伊敏项目无人驾驶车辆
打开网易新闻 查看精彩图片
图2 : 中科慧拓参与建设的华能伊敏项目无人驾驶车辆

更棘手的是数据的分布问题。矿山作业的安全容错率极低,一次调度失误造成的碰撞或停工,代价远高于公开道路上的一次算法接管失误。重载设备密集混编,边坡位移、路面破损、设备交互冲突等隐患随时可能出现,但这些真正决定系统能力边界的极端工况,在现实中数月难遇一次。极端场景数据难以采集,是矿山数据积累的结构性困境。

行业早期的应对方式是在项目现场慢慢攒数据,但这种模式的瓶颈很明显:单点数据体量小、场景覆盖面窄,算法迭代依赖现场调试,每换一个新矿区都几乎都要从头再来。十几台矿卡的无人化作业试点验证项目可以勉强做出来,但几十台、上百台的超大吨位重载矿卡集群常态化作业,对数据规模和场景覆盖的要求完全是另一个量级。

矿山智能化走到今天,竞争的关键已经从单车智能转向了数据能力,即谁能用更低的成本、更短的时间,积累起覆盖更全、质量更高的矿山工况数据,谁就能支撑算法持续进化。这正是中科慧拓矿山多模态数据平台要解决的核心问题。

2

从平行理论出发,建造一座虚拟矿山

打开网易新闻 查看精彩图片

中科慧拓的数据底座不是孤立的数据采集系统,它嵌套于更大的技术框架里。落到产品上,这套框架呈现为"愚公矿山操作系统(OS)+ 人工智能大模型(M)+ 载山智能装备内核(V)"的OS+M+V技术底座,共同组成一套"平行矿山"全栈解决方案。

平行矿山的核心逻辑是"虚实平行、协同运转"。物理矿区作为真实生产主场,持续完成开采、运输、排土作业,同时回传现场工况、设备运行与环境变化数据。虚拟矿山则作为数字推演训练场,依托真实数据持续校准场景模型,无限逼近真实矿区状态。整套体系形成"数据采集训练—模型演化升级—前瞻仿真推演—策略下发落地"的循环链路。

这个架构与行业惯用做法有所不同。当前,多数矿山智能系统是在传统自动化架构上叠加新功能,相当于在老旧建筑上反复翻新,地基与框架的限制始终存在。而平行矿山是从底层理论出发搭建的原生架构,虚拟世界不是真实世界的附属品,而是与物理生产对等运转的另一半系统,数据在两个世界之间双向流动,算法在虚拟端先验证、再下发,现场的每一次作业又反过来充实虚拟端。

这套架构的工程化程度,决定了数据底座的产能上限。中科慧拓的无人运输平行仿真系统,可以对露天矿山进行高逼真度三维重建,基于真实调度平台、大批量无人驾驶控制器和精准车辆动力学内核——车辆悬架、轮胎变形、转向油压均在模拟范围内——实现上百台虚拟矿卡在整体矿山区域内的并发测试运行,并完成与真实场景、真实车辆之间虚实互动的数字孪生平行仿真测试。

换言之,在数据进入训练管线之前,这座虚拟矿山已经是一座可以规模化"生产"数据的工厂。

3

六大能力,定义矿山数据平台

打开网易新闻 查看精彩图片

面向智能矿山大模型训练、无人化作业和行业智能应用的需求,中科慧拓依托平行矿山解决方案,打造了矿山多模态数据平台,构建起覆盖六大环节的能力体系:数据采集与汇聚、高质量加工与管理、质量评测、应用与场景验证、安全保障,以及硬件资源支撑。

平台持续沉淀的数据来源广泛。矿车无人驾驶数据、无人运输平行仿真数据、V2X智能路侧协同数据、设备运行数据与生产作业数据,多源异构,模态各异。这些数据经过标准化治理、多模态标注与对齐、质量评测和安全管控,形成面向预训练、指令微调、偏好对齐和基准测试的高质量数据生产能力。

值得留意的是这四个数据产品方向的划分。预训练、指令微调、偏好对齐、基准测试——这基本是大模型训练范式的标准流程在矿山领域的完整映射。这意味着数据平台的设计目标,不是简单地给某个算法模块供数,而是按照"训练矿山大模型"的完整生命周期来组织数据生产:预训练数据让模型建立对矿山物理规律的基础认知,指令微调数据让模型适配具体作业任务,偏好对齐数据让模型的决策符合矿山生产的安全与效率约束,基准测试数据则用于持续衡量模型能力的边界。

围绕无人驾驶、智能开采、安全生产、设备运维和应急管理等典型场景,平台打通了"数据采集—智能加工—质量评测—模型训练—场景验证—持续优化"的全流程闭环。这套流程的目标,是让矿山数据完成一次身份转换:从生产过程的副产品,变成可以持续增值的智能资产。数据不再只是记录了什么,而是能源源不断训练出更强模型的生产资料。

4

10%真实、85%虚拟、5%人工,数据底座的结构性设计

打开网易新闻 查看精彩图片

这套数据底座极具辨识度的设计,是它的数据构成比例:以无人驾驶现场真实数据为基础(约10%),以虚拟世界泛化生成数据为主体(约85%),以数字矿山人工作业数据为场景补充(约5%)。

比例结构背后,是对矿山数据经济性的分析计算。

真实数据是底座中不可替代的部分,它的作用是为仿真体系提供物理锚点。中科慧拓在真实数据积累方面展开了前瞻性探索。例如,2020年起,中科慧拓联合国家能源集团旗下神宝能源、航天重工,在国家能源集团宝日希勒露天煤矿启动了极寒型复杂气候环境露天煤矿无人驾驶卡车编组安全示范工程。2021年9月,项目通过中国煤炭工业协会组织的工业性示范运行安全评审和科技成果鉴定、以及国家能源集团组织的项目验收,成果被评定达到国际先进水平。这座大型露天煤矿承担着东北三省的煤炭保供任务,冬季气温动辄低至零下四五十摄氏度,总重接近400吨的重型矿车在矿区内24小时穿梭作业,驾驶室内空无一人,实现了极寒气候下的“全天候、真无人”。目前,中科慧拓已在全国22省、自治区落地了40余座无人矿山,推动无人矿卡从示范走向批量化运营,这类项目持续回传的真实工况数据,构成了数据底座中最具含金量的10%。

打开网易新闻 查看精彩图片

图3 : 中科慧拓参与建设的雁宝能源宝日希勒矿项目无人驾驶车辆

真正的规模杠杆在85%的虚拟数据上。现实中数月难遇的极端工况和边界场景,在虚拟矿山中可以批量生成。天气突变、设备异常、多车集群冲突、边坡隐患、运力失衡,都可以在高保真仿真环境中反复模拟。更重要的是成本结构。虚拟迭代替代了大量现场调试,仿真验证替代了高危试错,算法研发不再需要以设备损耗和停工减产为代价。虚拟矿山同时还是一座"零损耗、零风险"的训练场所,矿区调度、操作、运维人员可以在虚拟场景中反复演练设备操作、故障处置与集群调度,不占用生产设备,不影响正常产能。

剩余的5%来自数字矿山人工作业数据。在完全无人化到来之前,矿山中大量作业仍需由人完成,这些真实的人工作业数据为模型提供了人类驾驶员的操作先验,也补齐了无人系统尚未覆盖的场景拼图。

三者合流,形成一套"落地越多、数据越全、模型越优、成本越低"的正向循环——真实项目验证算法,算法能力反哺仿真真实度,仿真规模摊薄数据成本,成本下降又支撑更多项目落地。

5

从单车无人到集群智能,数据底座的下游价值

打开网易新闻 查看精彩图片

数据底座的价值,最终要在装备和运营层面兑现。

在装备端,2023年5月,由中科院自动化所、国际先进技术应用推进中心、中国矿业大学(北京)内蒙古研究院与中科慧拓联合孵化的矿山智能运载机器人"载山CarMo"在内蒙古鄂尔多斯发布,并于当月在东胜区露天煤矿投入无人编组作业运行。这是全国首台套矿山智能运载机器人,与对有人驾驶车辆进行后装改造的传统方案不同,"载山"从设计之初就是正向研发的无人运载装备,这使其在数据采集层面具备天然优势:整车传感器的布局、数据接口的标准、控制链路的开放程度,都不必迁就人类驾驶舱的历史遗留设计。

打开网易新闻 查看精彩图片

图4 : 矿山智能运载机器人载山CARMO

在运营端,数据底座支撑的是从示范试点到规模化常态运营的跨越。百台级超大吨位重载矿卡集群的常态化作业,是行业公认的规模化门槛:重载设备混编工况动态复杂、协同难度大、安全容错率极低。中科慧拓的做法是在大规模虚拟并发推演中完整模拟集群作业场景,持续优化调度逻辑、打磨边界工况处理能力,再将验证后的策略下发物理现场。所有新算法、新策略、新功能,均先在虚拟环境完成全覆盖、高压力、极端场景测试,验证稳定后再批量落地矿区。

这套能力也在向外延伸。2023年10月,中科慧拓与泰国SCG集团、AIS、华为、宇通共同签署泰国首个5G+自动驾驶智慧绿色矿山项目,落地SCG位于沙拉武里府的矿区。海外矿区的工况、矿种、设备体系与国内差异显著,项目得以输出的前提,恰恰是底层架构的通用性,即同一技术底座适配全品类矿用装备与全场景工况,核心模块可跨项目、跨矿区复用,而不需要为每个新矿区重建一套系统。

6

物理AI时代,数据资产的定义正被改写

打开网易新闻 查看精彩图片

把视角拉回行业。物理AI的叙事正在从概念走向工程,而工程化的第一道分水岭,就是数据基础设施。

语言模型的经验已经证明,数据能力决定了模型能力的上限,也决定了迭代速度的差异。矿山行业的特殊性,在于它的数据不能从互联网抓取,不能靠补贴和地推堆出来,甚至不能完全依赖真实采集,它只能通过"真实锚点+虚拟工厂"的方式被制造出来。谁掌握了这套制造能力,谁就掌握了矿山智能化的底层生产资料。

打开网易新闻 查看精彩图片

图5 : 中科慧拓无人运输仿真系统编组会车运行测试(夜间)

从这个角度看,中科慧拓矿山多模态数据平台的意义,不在于某个单点指标的领先,而在于它把矿山数据的采集、治理、生产、验证组织成了一条可复制的流水线。

当然,这套体系也面临所有数据驱动系统的共性考验:仿真数据与真实世界之间的"保真度差"如何持续收敛,虚拟泛化数据的边际价值如何评估,以及当无人化规模继续扩大、场景继续外拓时,数据闭环能否保持同等效率运转。这些问题的答案,最终将在更多矿区的常态化运营中被发现。

可以确定的是,矿山这一传统行业正在经历生产资料的重新定义。过去,矿山最重要的资产埋在地层之下,而在物理AI时代,决定一座矿山智能化上限的资产,将越来越多地沉淀在数据平台之中。中科慧拓用一套虚实平行的体系,把矿山搬进了虚拟世界——在那里,算法可以先练一万次,再回到现实矿山,把每一次作业都变成下一次进化的数据。

图片来源:中科慧拓

阅读更多内容,欢迎订购《机器人产业》杂志。

点击跳转!圈内人都在看的专家观点

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片