BrainWAM:面向自动驾驶的语义先验与预测动力学动作空间协同

· 编辑团队 estimated
自动驾驶 VLA 世界模型 端到端 规划

BrainWAM是一种结构化的动作空间协同框架,将语义推理(VLA先验)与预测动力学(世界模型)统一用于端到端自动驾驶,在NAVSIM v1上达到89.5 PDMS、NAVSIM v2上达到89.6 EPDMS的领先水平,并通过异步整流流推理缩短推理延迟。

原文 · arXiv:2608.12854

端到端自动驾驶面临一个双重要求:规划器既要尊重语义约束(交通规则、场景理解、指令遵循),又要预测世界如何演化(其他交通参与者的未来轨迹)。当前两大主流范式各覆盖其一:视觉-语言-动作(VLA)模型借助预训练视觉语言模型带来强大的语义先验;世界动作模型(WAM)则通过学习世界动力学生成面向未来的预测。真正需要两者兼备的规划器必须调和二者——而朴素的融合方式出人意料地困难。

核心创新

作者指出了一个具体的失败模式:当VLA与世界模型流通过联合的token级注意力拼接时,会产生”注意力分配失衡”——语义捷径主导了共享注意力空间,压制了预测动力学。受神经科学中”复杂行为源于功能特化系统间的协调”这一证据启发,BrainWAM将两种范式转化为两条特化的动作导向通路,并在紧凑动作表示层面进行对齐,而非在原始token层面。

第二项贡献是异步整流流推理策略,将视频与动作去噪解耦,在缩短推理延迟的同时保留与规划相关的预测上下文——这对实时驾驶系统是实际的工程关切。

实验结果

  • NAVSIM v1达到领先水平:89.5 PDMS
  • NAVSIM v2达到领先水平:89.6 EPDMS
  • 在两个基准上均一致优于纯VLA与纯WAM方法
  • 异步整流流推理在保留预测上下文的同时降低延迟

局限性

结果均来自NAVISIM仿真基准,摘要未描述真实世界闭环验证。协同机制在两大模型族之上增加了架构复杂度,摘要也未量化训练成本与模型规模。“注意力分配失衡”的诊断很有说服力,但其在其他VLA/WAM组合上的普适性仍有待验证。

行业影响

对自动驾驶技术栈而言,本文回答了一个首要的架构问题:如何融合语言推理与世界模型,而不让任一能力拖累另一方。在两个NAVISIM版本上都取得SOTA并同时降低推理延迟,使其对实时部署颇具吸引力。随着行业向基础模型驱动的规划器收敛,“在动作层面协调特化通路”而非寄望于token级注意力自行解决的设计思路,为同时兼顾语义合规与预测安全的生产级系统提供了一个具体可循的范式。