LaPla:离散思维与连续动作——端到端自动驾驶的潜在对齐规划
· 编辑团队 estimated
自动驾驶 视觉-语言-动作模型 规划 世界模型 端到端
LaPla 是一个带潜在对齐规划的视觉-语言-动作(VLA)框架,把语义理解落地为精确的运动执行。它先用残差向量量化 VAE 构建捕捉车辆运动学的动作分词器,再把该表示当作连续物理先验而非离散码本:并发动作查询在单次前向中因果地关注多模态上下文,把隐状态直接投影到预训练潜在空间,由冻结解码器转译为动作——既消除了量化误差,也绕开了自回归生成。在 nuScenes 上,LaPla 相比最先进 VLA 方法将长时域 L2 误差降低 15.52%;在 NVIDIA AlpaSim 闭环评测中成功率提升 33.34 个百分点,推理延迟显著降低。
原文 · arXiv:2609.04070视觉语言模型的离散式推理与自动驾驶连续、受物理约束的本质之间始终存在鸿沟。LaPla 的核心主张是:动作 token 应当充当连续的物理先验而非离散码,语义理解因此可以直接 grounding 到平滑、可执行的运动上。
核心创新
- 残差 VQ-VAE 动作分词器充当物理先验——车辆运动学被编码进结构化潜在空间,但系统不做离散码本查询,而是把该表示用于弥合高层语义与原始动作之间的模态鸿沟。
- 单次前向的潜在对齐规划——并发动作查询因果地关注多视角图像、历史动作与文本指令,将隐状态直接投影到预训练潜在空间。
- 冻结解码器、无自回归——连续潜在向量被解码为物理上合理的轨迹,消除量化误差并绕开耗时的自回归生成。
实验结果
- nuScenes 开环:相比最先进 VLA 方法,长时域 L2 误差降低 15.52%。
- NVIDIA AlpaSim 闭环:成功率提升 33.34 个百分点,推理延迟显著下降,行驶进程更平滑。
局限性
摘要报告的是 nuScenes 开环与 AlpaSim 模拟器闭环结果,尚未给出真实道路闭环驾驶验证;方法依赖预训练 VQ-VAE 潜在空间的质量与所用仿真器的保真度;更长时间尺度、更多场景下的表现仍需进一步证明。
行业影响
自动驾驶技术栈正开始采纳 VLA 架构,但延迟与轨迹质量使其难以进入安全关键的闭环。LaPla 展示了从”离散思维”模型中单次前向解码出连续、物理合理轨迹的具体路径——更低的推理延迟叠加闭环成功率 33 个百分点的提升,正是量产规划栈与未来基础模型驾驶系统最需要的那类证据。