DreamWAM:超越 RGB 的未来预测——世界动作模型的新范式
DreamWAM 将世界动作模型中的未来预测重构为超越 RGB 的结构化建模——训练时联合预测外观、运动、几何与语义,推理时仍只依赖 RGB。它在 LIBERO 上将匹配的 RGB-only 基线从 97.30% 提升至 98.40%,在未见过的 LIBERO-Plus 扰动下增益更为显著(51.36% 提升至 63.44%),并在真实世界中把平均成功率从 55.6% 提升至 74.4%(面对未见过的光照、背景与物体布局变化)。代码与模型已开源。
原文 · arXiv:2608.04996背景
世界动作模型(WAM)通过预测世界在智能体动作下如何演化来学习表征,并以此支撑动作生成。现有的大多数 WAM 都在 RGB 空间里预测未来,而任务相关的状态转移恰恰与纹理、光照、背景、视角等无关变化纠缠在一起。结果是:模型可能很擅长预测像素,却对控制真正关心的状态变化缺乏 grounding。本文的核心主张是——稳健的世界动作学习不能只靠预测未来,还必须以对动作有意义的形式表征未来。
核心创新
DreamWAM 把未来预测重构为超越 RGB 的结构化世界建模:未来状态通过外观、运动、几何、语义四个互补视角来表征。训练时,模型联合去噪 RGB 与运动隐变量,并为几何与语义加上轻量门控残差分支;视频分支(VideoDiT)与动作分支(ActionDiT)之间的共享注意力让动作策略能够从这些未来状态预测中学习。一个对部署非常友好的特性是:所有超越 RGB 的监督分支在推理时全部关闭——模型只以 RGB 运行,增加的监督只用于改进所学表征,不带来任何运行时开销。
实验结果
在无 rollout 与联合视频-动作推理两种模式下,DreamWAM 在 LIBERO 上持续优于匹配的 RGB-only 基线,分别从 97.30% 提升到 98.40%、从 98.00% 提升到 98.90%。在未见过的 LIBERO-Plus 扰动下增益大幅扩大:从 51.36% 提升到 63.44%、从 69.16% 提升到 75.47%。这种鲁棒性延伸到真实世界操作:面对未见过的光照、背景与物体布局变化,DreamWAM 的平均成功率达 74.4%,而 Fast-WAM-Joint 基线仅为 55.6%。代码与模型公开释出,是很强的可复现性信号。
局限性
报告中的增益虽然一致,但集中在面向鲁棒性的评测与作者自设的基准配置上;在标准操作套件上的独立复现会进一步增强说服力。真实世界评测以汇总形式给出,无法从摘要中看到各扰动条件下的具体差异(例如哪类扰动最难)。架构在训练期引入了多条监督分支的额外复杂度,各分支(除运动外)的实际收益在摘要中未展开说明。
行业影响
对视觉扰动的鲁棒性,正是”实验室里能用的操作策略”与”能在工厂车间或家庭中生存的策略”之间的分水岭。DreamWAM 的结论——训练期做结构化多模态未来预测,能在零推理成本下显著提升分布外表现——对训练操作策略的团队有直接的可操作性。公开的代码与模型降低了采用门槛,而 RGB-only 的部署形态意味着无需为现有系统更换传感器或硬件。对 VLA 与世界模型从业者而言,这是”训练时监督超越 RGB 的状态”这一方向的有力论据。