BWM:面向机器人学习的低成本高保真世界模拟器
BWM 是一个开源、低成本、动作条件的世界模型,可预测机器人操作任务的未来观测,既可作为数据引擎,用动作对齐的 rollout 扩充模仿学习数据,也可作为策略评估器,用于闭环评估、风险预判与策略排序。它在 WorldArena 挑战赛中 Track 1 与两个 Track 2 应用中总排名第一,并已开源模型权重、训练与推理代码及接口。
原文 · arXiv:2607.29302背景
可靠的机器人学习需要一个能在实体硬件上执行之前预测动作后果的世界模拟器——包括高风险和易失败的结局。现有物理仿真器需要大量的资产构建与标定工作,且仍面临 sim-to-real 差距;视频生成模型则往往无法精确控制对细粒度机器人动作的响应。这构成了实际瓶颈:团队要么为重型仿真基础设施付费,要么冒着风险与成本直接在硬件上评估策略。
核心创新
BWM(Boundless World Model)是一个动作条件世界模型,结合初始环境引导、动态视觉历史与时间对齐的机器人动作条件,对有状态的未来观测进行自回归预测。为构建高质量训练数据,作者通过轨迹回放、重叠片段采样与初始观测增强来构造动作对齐的训练片段。BWM 被设计为双用途工具:一是数据引擎,用动作对齐的 rollout 扩充模仿学习数据;二是策略评估器,用于闭环评估、风险预判与策略排序。
实验结果
在 WorldArena 基准与实体机器人上的实验表明,BWM 在数据引擎与策略评估两种模式下都提升了模拟器保真度与功能实用性。BWM 在 WorldArena 挑战赛中 Track 1 及其两个 Track 2 应用中总排名第一。作者发布了完整的开源生态:模型权重、训练与推理代码,以及数据生成与策略评估接口。
局限性
作为学习型世界模型,BWM 继承了长程预测误差累积的固有风险,其保真度受限于训练数据的分布。评估聚焦于操作类场景,未覆盖腿足、空中、移动等其他本体类别。与经典仿真管线相比,构造动作对齐训练片段的成本也未被完整量化。
行业影响
能低成本预测动作后果的世界模拟器,直击商业机器人学习的核心瓶颈:数据收集与策略评估。这类开源、低成本的模型让无力承担大规模物理资产管线的团队也能获得高保真仿真能力,可直接用于合成数据生成、安全测试、风险预判与模型选型。在业界普遍寻找人类遥操作数据可扩展替代方案的当下,“数据引擎”模式——用世界模型 rollout 扩充模仿数据——尤其具有现实意义。