坐在自动驾驶车里,车辆在空旷道路上突然急刹,司机和乘客都一脸茫然——没有任何办法知道它为什么这么做。这不是偶发故障,而是当前自动驾驶AI的普遍困境:神经网络能做出不错的决策,却从不解释自己的理由。
Motional与MIT的研究团队近日发布了一项新成果,试图打破这层“黑箱”。相关论文已发表在《Nature》上。他们提出的方案名为Concept-Wrapper Network(简称CW-Net),核心思路是把自动驾驶系统神经网络的内部计算,翻译成人类能直接读懂的概念。
把神经网络逻辑翻译成人话
CW-Net的工作方式,是将自动驾驶系统的内部逻辑转化为类似“接近停驻车辆”“靠近骑行者”这样的概念。据Motional介绍,这些概念可以实时显示在仪表盘上,让车内人员看到当前哪些因素正在影响车辆的驾驶决策。
这套系统的关键设计在于:解释不是事后生成的猜测。车辆的最终决策系统直接基于这些人类可读的概念采取行动,因此一次刹车行为可以追溯到触发它的具体概念。Motional将这种特性称为“因果忠实”(causally faithful),以此区别于那些生成自然语言解释的方案——后者读起来可能合理,但不一定准确。
Motional CEO Laura Major参与了这项研究,她将这种可解释性与纯粹依赖端到端深度学习处理驾驶决策的路线做了对比。
“纯粹的端到端方法可以达到80-90%,甚至95%的解决方案,但这还不足以移除驾驶员,也不足以赢得城市、社区和客户的信任。”Major说。
在拉斯维加斯真实路测,而非实验室模拟
据Motional介绍,可解释AI研究大多停留在实验室的计算机模拟环境中。而Motional与MIT团队这次把CW-Net部署到了一辆真实的自动驾驶车辆上,由经验丰富的安全操作员坐在驾驶位,在私人测试跑道和拉斯维加斯周边的公共道路上收集数据。
团队使用的是早期实验版本的深度学习规划系统,该系统表现出有竞争力的性能,但也存在一些明显缺陷——而CW-Net恰好能帮助暴露这些问题。测试中的两个事件说明了这套系统捕捉到了什么。
其中一次,自动驾驶车辆反复在交通锥桶附近停车,车辆操作员以为是锥桶本身触发了这一行为。研究人员随后通过CW-Net发现,实际触发因素并非锥桶本身,而是车辆对锥桶周围区域的某种特定判断——这种判断在传统黑箱系统中完全无法被察觉。
这类案例揭示了一个深层问题:当自动驾驶系统出错时,如果工程师无法定位错误的具体来源,修复就无从谈起。CW-Net的价值在于,它让“为什么”这个问题第一次有了可追溯的答案。
可解释性不是锦上添花,而是信任的前提
自动驾驶要真正进入城市公共交通体系,面临的不仅是技术挑战,还有公众信任问题。一个无法解释自身行为的系统,很难让监管机构、城市管理者和普通乘客放心接受。Major的表述点明了这一层:95%的准确率在实验室里是优秀成绩,但在真实道路上,那剩下的5%恰恰是事故发生的区间。
CW-Net的路线选择也值得注意——它没有在事后用语言模型“编造”解释,而是让决策本身建立在可解释的概念之上。这意味着解释与行为之间是因果关系,而非相关性。对于安全攸关的自动驾驶场景,这种设计逻辑显然更站得住脚。
当然,这套系统仍处于早期验证阶段。研究团队使用的是实验版本的规划系统,测试规模也有限。但从方向上看,让AI“开口说话”的能力,正在从实验室走向真实道路——这可能是自动驾驶赢得信任的关键一步。
热门跟贴