科学问题
自动驾驶规划器多是黑盒模型,遇到罕见场景时的失误难以预判,后果可能很严重。此前的可解释性研究大多停留在仿真或简化任务中,缺乏因果保真度,也未在真实部署里检验实用性。本文要解决的是:能否让实车规划器在不牺牲驾驶性能的前提下,输出因果忠实、人类能懂的行为解释,并据此改善人机协同。
背景与领域脉络
消费级车辆普遍采用机器学习规划器,在异常或复杂场景中仍需人类接管,而黑盒特性让驾驶员无法预判它的决策。学界尝试用事后显著图或大语言模型生成解释,但这些解释并非模型决策的实际输入,存在“编故事”的风险。若把认知心理学中的概念模型与概念瓶颈网络结合,让概念成为决策的必经环节,就有可能在保持控制性能的同时让推理过程透明。
方法与技术路线
作者提出概念包装网络(CW-Net)。他们先用 80 小时人类专家驾驶数据,通过逆向强化学习训练黑盒规划器。随后冻结原模型的场景与轨迹编码器,把顶层奖励层替换为概念分类器加一个轻量新奖励层。网络联合训练概念标签与轨迹决策,使规划器只能依据显式的人类概念来选择动作。团队先在 nuPlan 闭环基准上评测,再通过 Lab2Car 框架把模型部署到真实自动驾驶车上,在封闭测试场开展半自然驾驶验证,并与车上安全员的心智模型变化做对照。
主要结果
包装之后性能几乎不变,决策却变得可读
在 nuPlan 闭环测试中,CW-Net 包装后的规划器与原黑盒模型各项驾驶指标差异均小于 1%。概念分类在保留测试集上的平均召回率 77%、准确率 54%、精确率 23%、F1 为 0.31,说明模型在保住行车安全的同时,把决策落到了可读的概念上。
纠正了安全员对莫名刹车的误判
实车在乘客上下车区域前反复莫名停车,安全员原以为是落客区逻辑所致。但 CW-Net 持续输出“接近其他车辆”(CLOSE)概念:最小二乘回归显示,CLOSE 概率与车速显著负相关(Pearson r=−0.558,截距 0.944)。这说明停车是训练场景匹配的结果,而非地址逻辑。
暴露了幽灵刹车的真正诱因
车辆在路障锥桶旁频繁异常刹车,安全员最初认定锥桶是诱因。但 CW-Net 在刹车前都出现“接近停止车辆”(ASV)概念的高概率峰值。把锥桶移走后,车辆仍在同一位置刹车,概念曲线高度一致:动态时间规整的 L2 相似度为 7.37 与 1.6,而随机事件的 L2 距离大于 20。原因因此被改判为训练场景匹配。
识别出感知链路盲区并改变接管策略
测试中车辆安全避让了骑行者,但“接近骑行者”(BIKE)概念概率始终低于 1%。安全员据此判断感知与规划链路存在盲区,在后续 23 组测试中主动下调切入自动驾驶的初速度;后续分析证实规划器确实漏接了自行车输入,此前的制动来自底层独立的防护逻辑。
创新点
与 LIME、CAM 或大模型事后解释这类“先决策、后解释”的路线不同,CW-Net 把概念瓶颈与案例推理结合起来,只冻结并微调顶层结构即可适配任意预训练规划器。关键在于因果忠实:概念分类器的输出是新奖励层的唯一输入,直接决定轨迹选择,从机制上排除了解释与行为脱节的可能。
意义与影响
该工作打破了可解释 AI 只能在玩具环境里演示的僵局,首次在真实车辆的道路部署中验证了解释的实用价值,并证明透明的因果概念可以直接校准人类使用者的心智模型。架构即插即用,向自主无人机、手术机器人等安全攸关系统迁移的门槛较低。
局限与待验证
概念标签依赖人工预设的场景词典,面对全新的复杂场景可能无法覆盖。概念分类的精确率仅 23%,在部分边缘场景中仍会出现假阳性激活。车内可视化界面连续展示概念百分数,对非专业乘客可能造成认知负荷,界面的人因验证仍不充分。
对我们的相关性
对做生物医学大模型的人来说,CW-Net 提供了一条通用思路。它把无监督的潜在表征投影到领域先验概念(如通路激活、转录因子结合),在不牺牲预训练精度的前提下获得可归因的决策解释。这一范式对单细胞命运推断、基因调控网络反卷积等黑盒任务同样适用。
术语速查
全文 PDF 已归档 Google Drive
04-学术文献/Paper/;原文版权归 Nature 及作者所有