FactorDrive:由规划关键因子驱动的自适应多步推理端到端自动驾驶

· Editorial Team estimated
自动驾驶 端到端规划 思维链 GRPO 视觉语言模型

FactorDrive 是一个端到端自动驾驶框架,将规划推理锚定在与轨迹相关的空间-物理证据上,并根据场景特定的规划需求自适应推理深度。它以大规模驾驶域指令微调为基础,构建了围绕规划关键因子(PCF)组织的 PCF-CoT 思维链数据集,并提出 QS-GRPO:用轨迹级规划奖励引导蒙特卡洛树搜索(MCTS)发现更高质量的推理路径,再通过 GRPO 优化策略。在开环 nuScenes 与面向闭环的 NAVSIM 基准上的大量实验表明,FactorDrive 取得了最先进的规划性能。

原文 · arXiv:2608.09591

背景

视觉语言模型为端到端自动驾驶带来了显式推理,但仍存在两个缺口。其一,现有方法未能将空间-物理证据充分融入规划推理——思维链往往悬浮于真正决定轨迹质量的几何与动力学之上。其二,推理自适应粒度粗糙:模型对几乎每个场景采用相同的推理模式,而不是根据场景的规划需求进行调整。最后,自动驾驶后训练中几乎没有探索对推理路径本身的优化,推理过程沦为指令微调的固定副产品。

核心创新

FactorDrive 围绕规划关键因子(PCF)组织规划推理。在大规模驾驶域指令微调建立基础驾驶知识后,作者构建了 PCF-CoT 思维链数据集:将推理锚定在轨迹相关的空间-物理证据上,并围绕场景特定的 PCF 组织思维链,使推理路径的组合与深度能够适应不同的规划需求。在此基础上,QS-GRPO(质量搜索引导的组相对策略优化)用轨迹级规划奖励引导蒙特卡洛树搜索(MCTS),发现能带来更高规划质量的推理路径,再用这些响应通过 GRPO 优化策略——把推理路径搜索作为后训练的一等公民,而非事后补丁。

结果

在开环(nuScenes)与面向闭环(NAVSIM)基准上的大量实验表明,FactorDrive 取得了最先进的规划性能。评估覆盖了驾驶社区使用的两种主要评估范式,增益来自 PCF 锚定的推理与搜索引导的推理优化相结合,而非单纯扩大模型规模。

局限

摘要报告了最先进的结果,但未给出逐指标明细,相对此前端到端规划器的提升幅度尚未公开量化。评估以基准为主,真实世界闭环验证与安全关键边缘场景分析仍有待报告。MCTS 引导的推理搜索增加了后训练与推理复杂度,在量产场景中需要与规划增益进行权衡。

产业启示

端到端规划是自动驾驶技术栈的核心战场,而可验证、有证据支撑的推理正是监管方与安全团队对学习型规划器日益增长的要求。FactorDrive 证明了推理路径可以被显式搜索与优化——且使用轨迹级奖励——这为在不扩大模型的前提下提升规划质量提供了实用方案。对于构建量产驾驶系统的公司,场景自适应推理深度与搜索优化的思维链相结合,对规划的既性能又可解释性都直接相关。