Pictura: 基于第一视角的大规模自博弈自动驾驶策略学习
Pictura 是一个 GPU 加速的多智能体驾驶模拟器,在每个时间步渲染每个智能体的自我中心视角,首次实现了无需特权观测、直接基于第一视角图像的大规模驾驶自博弈策略训练。训练出的 Alberti 策略性能接近使用特权向量化观测的对应策略,并能零样本迁移至 Waymo 数据集。
原文 · arXiv:2607.26005背景
通过仿真中自博弈训练的自动驾驶策略已取得显著成果,但它们通常依赖特权向量化观测——包括被遮挡智能体在内的精确位姿和速度信息。这带来了部署时智能体仅从自我中心相机视角行驶的表示鸿沟。标准解决方案——将特权教师策略蒸馏到仅使用相机的学生模型——使得学生模仿其自身有限视角无法验证的决策,形成性能天花板。
核心创新
Pictura 提出了一个 GPU 加速的多智能体驾驶模拟器,在每个仿真步骤中渲染每个智能体的第一视角图像,在单个 H100 GPU 上达到每秒 50 万智能体步(200 万张图像)。这使得训练时的观测模态与部署时的观测模态完全一致,从源头上消除了表示鸿沟。
基于 Pictura,作者训练了 Alberti——首个完全无需特权观测、直接基于第一视角图像训练的大规模自动驾驶自博弈策略。训练规模达到 500 亿智能体步,约合 3500 万公里驾驶里程,仅使用纯 PPO 算法,没有任何辅助监督或特权蒸馏。
实验结果
Alberti 在标准基准测试中接近其特权向量化对应策略的性能。更值得注意的是,当零样本迁移至 Pictura 模拟器中重渲染的 Waymo Open Motion Dataset 场景布局时,第一视角策略反而超越了特权向量化智能体,表明直接的第一视角训练能产生更具泛化性的驾驶行为。
局限性
当前工作完全在仿真环境中进行,策略尚未部署于真实车辆。第一视角策略的仿真到真实迁移仍是一个开放挑战,但无需特权观测和使用逼真渲染应能比先前工作缩小迁移差距。
行业影响
对自动驾驶团队而言,Pictura 证明了特权观测可以在训练流程中被完全消除——这一结果具有重要的实践意义。如果第一视角自博弈能够扩展到现实部署,它将消除整个感知堆栈作为训练依赖的需求,使得驾驶策略可以直接从仿真中端到端学习。单个 H100 上每秒 200 万图像的吞吐量也使基于相机的大规模训练在经济上切实可行。