SA-WAM:几何潜在扩散的空间感知世界动作模型
· 编辑团队 estimated
世界模型 机器人学习 视频扩散 深度感知 操作
SA-WAM 将预训练视频扩散模型改造为空间感知的世界动作模型:在单一扩散骨干内同时预测动作、RGB 与深度。非线性编码把无界的深度信号映射到冻结 VAE tokenizer 的有界输入域,无需三维微调即可引入几何信息。SA-WAM 在 RoboCasa 与 LIBERO-Plus 上取得最先进结果,同时改善未来状态预测,并在真实 UR5 机械臂上优于强基线,在随机化环境中增益尤为显著。
原文 · arXiv:2609.02531基于大规模预训练视频扩散模型的世界动作模型(World Action Model, WAM)联合预测未来观测与动作,继承了互联网级视频中丰富的视觉与物理先验,已成为机器人策略学习的热门范式。但现有模型几乎只消费 RGB 图像,完全不用三维信息——而操作问题本质上是几何问题。SA-WAM 要回答的是:如何让世界动作模型拥有空间感知,又不丢掉让预训练真正起作用的先验?
核心创新
- 单骨干联合预测——把预训练视频模型改造成同时预测动作、RGB 与深度的单一扩散骨干,动作生成与三维感知共用一个模型,无需两套系统。
- 冻结分词器的几何编码——用非线性编码把无界的深度信号映射到冻结 VAE tokenizer 期望的有界输入域,从而在不做任何三维专用微调的前提下引入几何信息,预训练先验完整保留。
- 预测质量归因分析——论文剖析世界模型预测质量与下游 rollout 成功率之间的相关性,指明 WAM 收益的真实来源。
实验结果
- 在 RoboCasa 与 LIBERO-Plus 基准上取得最先进结果,同时未来状态预测质量也获得改善。
- 真实世界评测中优于强基线(UR5 机械臂),且在随机化环境中增益最大。
- 消融实验显示更好的世界模型预测对应更高的任务成功率,厘清了空间感知何时最有用。
局限性
摘要中的结果集中在桌面/厨房式操作与单臂真机验证,移动平台与人形平台上的表现尚待验证。实际部署需要在推理时获得深度信息(RGB-D 传感器或上游深度估计器);有界域编码对极近或极远几何可能产生压缩。摘要未给出失败案例分析或规模化部署层面的研究。
行业影响
三维感知世界模型直接关系到机器人学习的成本结构:如果无需三维微调就能给预训练视频基础模型补上几何”常识”,构建通用操作策略的团队就能显著减少任务专用数据的采集投入。UR5 真机上的增益——尤其在不那么受控的随机化环境中——指向分拣、上下料这类场景几何多变的工业操作。对平台厂商而言,“在输入编码层加入深度、保留预训练骨干”是一条低成本、可复用的升级路径。