Driving on Memory:仅凭记忆完成驾驶评测

· 编辑团队 estimated
自动驾驶 基准测试 端到端驾驶 navsim 评测方法论

这项研究探明了一个问题:NAVSIM分数中有多少真正来自对动态交通场景的反应。作者移除驾驶模型的摄像头输入,改用同一地点先前驾驶的记忆——即道路布局等持久场景信息,但不含任何当前交通状态。仅凭记忆,模型在NAVSIM上就能达到甚至超越领先的端到端方法,说明高分并不需要模型对被测场景作出反应。该效应依赖具体基准:在Bench2Drive与RealEngine上,仅凭记忆驾驶会造成显著更大的性能下降。代码已开源。

原文 · arXiv:2608.31029

端到端自动驾驶模型直接从原始传感器输入规划未来轨迹。早期基准衡量与人类轨迹的偏差;NAVSIM、Bench2Drive等新一代基准则使用更丰富的、基于仿真的指标,旨在刻画安全合规的驾驶行为。隐含假设是:高分反映真实的场景理解——模型看到了前方场景并据此行动。这篇论文追问的正是:分数中有多少真的来自对场景动态部分的反应。

核心创新

实验设计简洁而巧妙:移除摄像头,用记忆替代。作者把模型的摄像头输入替换为从同一地点先前驾驶中检索到的记忆。这些记忆提供持久场景信息——道路布局、与位置相关的规律性——但关键的是,不含任何当前交通状态。

如果模型在这种条件下依然得分很高,那么它的基准表现从来就与”对前方交通作出反应”无关。论文还检验了该效应是否跨基准成立,将NAVSIM与Bench2Drive、RealEngine进行对比。

主要结果

  • NAVSIM: 记忆几乎足以胜任——在不观察被测场景的情况下,性能达到甚至超越领先的端到端方法。
  • 基准依赖性: 仅凭记忆驾驶在Bench2Drive与RealEngine上会造成显著更大的性能下降,说明这些基准确实要求对当前场景作出反应。
  • 结论: 高NAVSIM分数应谨慎解读;它未必要求规划器对当前交通作出反应。
  • 开源: 代码见 github.com/boschresearch/MemoryDrivoR。

局限性

这是一项评测研究而非新的驾驶方法,因此本身并不提升驾驶性能。记忆检索假设同一地点存在先前驾驶记录——这对新路线或罕至路线并不成立。论文在行为层面识别出NAVSIM奖励位置相关规律性的机制,但未将其完全拆解为指标层面的贡献分解。

产业意义

对评估端到端驾驶模型的团队——从主机厂到自动驾驶初创公司——这是一个及时且可直接行动的警示:如果NAVSIM分数能被地点记忆灌水,那么该基准上的模型排名未必反映真实驾驶技能,必须辅以Bench2Drive式基准或基于场景的测试。对更广的评测生态而言,它主张同时报告多个敏感度不同的基准,并把榜单分数同时视为场景先验证据与驾驶能力证据。