掩膜视觉动作:面向统一世界建模的像素空间控制接口

· Editorial Team estimated
世界模型 视觉动作 像素空间控制 机器人操控 逆建模

本文提出掩膜视觉动作(Masked Visual Actions),一种将机器人动作表示为视频中部分揭示轨迹的像素空间控制接口。仅用15小时掩膜示例微调,单个检查点即可在多样场景和多种机器人形态上实现高保真前向动力学预测和逆建模,并支持基于排名的模型预测规划和策略评估。

原文 · arXiv:2607.19343

背景

视频模型在其训练数据中蕴含了丰富的视觉世界运动、交互和接触响应先验知识,使其成为机器人世界建模的理想基础。然而,核心挑战在于如何以与视频模型学习这些交互先验的视觉空间相一致、同时又扎根于物理操控的方式,将动作信息传递到模型中。现有方法要么需要大量动作标注,要么局限于特定机器人形态。

核心创新

本文提出掩膜视觉动作(Masked Visual Actions),一种创新的像素空间控制接口。其核心思想是将机器人动作表示为视频中任意实体轨迹的部分揭示——通过揭示机器人运动,模型充当前向动力学模型,预测场景对底层机器人动作的响应;通过揭示目标物体的期望运动,同一模型恢复与该结果一致的机器人行为。这种对称设计使单个模型同时支持前向预测、逆建模和基于模型的规划,无需修改模型架构。

具体结果

仅用来自真实视频和仿真的15小时掩膜示例进行微调,单个检查点即在多样场景和多种机器人形态上实现了高保真视觉预测和可控性。在下游操控环境中,模型生成的想象 rollout 结果与实际执行结果具有相关性,可用于策略评估。在基于模型的规划中,通过排序候选未来提升了决策质量。在逆建模方面,能够从期望的物体运动合成机器人运动。

局限性

当前方法需要为每个场景提供掩膜轨迹示例,在完全未见过的机器人形态或操作类型上的泛化能力尚需进一步验证。15小时的训练数据虽然高效,但在极端复杂场景下的保真度边界尚未充分探索。

行业影响

该方法为机器人世界建模提供了一条极具扩展性的路径——利用视频模型已有的视觉先验知识,仅需少量动作标注即可适应新任务和机器人形态。这对降低机器人学习中的数据需求、实现跨形态知识迁移具有重要价值,有望加速机器人技能学习和策略部署的效率。