ModAR:先自回归去噪多种未来模态,再预测动作的世界-动作模型
世界-动作模型(WAM)通常联合建模未来观测与动作,并把未来观测默认为 RGB 图像;但深度图、预训练视觉特征与点轨迹能更高效地承载几何、语义与运动信息,如何在 WAM 中组合这些模态仍是开放问题。本文提出 ModAR,第一个在预测动作之前先自回归地去噪多种未来模态的 WAM,使每一次预测都以上一步生成的模态为条件。作者从零开始训练,系统研究训练数据配比、预测模态与 WAM 形式的影响,发现预测点轨迹、DINO 特征与深度图能带来收益,而额外预测未来 RGB 并没有一致的增益。ModAR 的平均成功率在所有评测数据规模上都高于既有 WAM 形式;在与用视频模型初始化的 Flex-π 同数据微调对比时,它以约二十分之一的训练算力、不做预训练,取得略高的观测平均成功率(75% 对 72%)。在三个真实双臂任务上,ModAR 优于基线并能从人类视频中继续获益。
原文 · arXiv:2609.17524世界-动作模型(World-Action Model, WAM)近年的主流做法是:把未来观测与动作放在一起联合预测,而未来观测几乎总是以 RGB 图像的形式表达。这一默认选择很少被质疑,但 RGB 未必是承载信息的最高效载体——深度图直接编码几何,预训练视觉特征(如 DINO)携带语义,点轨迹刻画运动,三者在信息密度上都可能优于逐像素重建。真正的问题因此不是「用哪种模态」,而是在一个 WAM 里如何组合并排序这些模态。
核心创新
ModAR 给出的是一个顺序生成的答案:它是第一个在预测动作之前就自回归地去噪多种未来模态的 WAM。每一步生成都以先前已经生成的模态为条件,因此模型可以按任意顺序逐步「铺开」未来,再据此产生动作。
为了把结论建立在受控证据上,作者从零开始训练,系统地扫描三个变量:
- 训练数据配比;
- 预测哪些模态(点轨迹、DINO 特征、深度图、RGB 的不同组合);
- WAM 的形式(顺序生成 vs 其他既有形式)。
实验结果
- 模态选择:预测点轨迹、DINO 特征与深度图都能带来收益;而在这些之外再预测未来 RGB 并没有一致的增益——这是对「WAM 必须重建像素」这一默认假设的直接反例。
- 模型形式:ModAR 的顺序生成在所有评测数据规模上都取得最高的平均成功率。
- 训练效率:作者把用视频模型初始化的 WAM(Flex-π)在同一批数据上微调作为对照,ModAR 以约 20 分之一的训练 FLOPs、且不做任何预训练,取得略高的观测平均成功率 75%(对照 72%)。
- 真实机器人:在三个真实双臂任务上,ModAR 优于基线,并且能从人类视频中继续获益。
局限性
摘要中领先的幅度不大:75% 对 72%,且措辞是「观测到的」平均成功率,未给出置信区间或多次重复的统计。逐任务数值、任务难度分布、机器人硬件与绝对性能均未披露,「在所有评测数据规模上最高」也缺少具体数字支撑。三个真实双臂任务之外,没有更广的泛化性、鲁棒性或分布偏移评测。此外,从零训练虽然省算力,但摘要未说明总训练规模与数据量,难以判断该结论是否只在小规模设定下成立。
行业影响
对正在搭世界模型管线的团队,这篇工作最实用的部分是一份**「不值得做的事」清单**:在未来模态上继续堆 RGB 重建很可能是在浪费算力,换成点轨迹、语义特征与深度更划算。而「不做预训练、用二十分之一 FLOPs 追平一个视频模型初始化的 WAM」这一对照,直接击中了世界模型的现实成本问题——视频预训练本身就是巨额开销。若该结论能在大规模设定下复现,世界-动作模型的准入门槛会显著下降,这对缺乏大规模视频预训练资源的机器人团队尤其有意义。