Orbis 2:面向驾驶的分层世界模型

· 编辑团队 estimated
自动驾驶 世界模型 扩散模型 表征学习

Orbis 2 提出了一种分层驾驶世界模型,采用扩散强迫预训练与教师强迫微调相结合的两阶段训练范式,在长时序生成质量、转向响应能力和内部表征质量上达到当前最优水平。

原文 · arXiv:2607.15898

当前的世界模型大多在单一抽象层次上运行,优先追求感知保真度,但缺乏真实世界任务所需的空间推理和语义理解能力。Orbis 2 将未来预测分解为两个层次:高层预测器在较长时域上预测粗略的场景结构,低层生成器以高层输出为条件生成精细预测。

核心创新。 论文包含两项关键贡献。首先,分层架构将预测分解到不同的时间尺度和抽象层次,同时获得高感知保真度和丰富的空间-语义表征。其次,两阶段训练范式:扩散强迫预训练产生更丰富的内部表征,而教师强迫(从干净上下文中预测下一帧)提供更稳定的自回归 rollout。两者结合——扩散强迫预训练后接教师强迫微调——实现了两全其美。

实验结果。 Orbis 2 在标准驾驶世界模型评估套件上取得了最优结果,包括长时序生成质量、反事实场景下的转向响应能力和内部表征质量。该模型在已建立的基准测试上显著优于先前的单层世界模型。代码、演示和模型权重已公开。

局限性。 分层设计需要精细调整层次之间的抽象边界。两阶段训练相比单阶段方法使训练成本翻倍。评估在标准驾驶基准上进行,而非真实世界的闭环部署。

产业意义。 高保真世界模型是端到端自动驾驶系统的关键组件。Orbis 2 的分层方法和实用训练策略有望影响自动驾驶系统中预测模块的设计,特别是在长时序规划和基于仿真的验证方面。