CLAP:跨形态视频世界模型,零样本的物理模拟器

· 编辑团队 estimated
视频世界模型 跨形态 机器人学习 具身智能 基础模型

CLAP在互联网规模的异构视频(涵盖人类与多种机器人)上训练动作条件视频世界模型,通过末端执行器位姿、语言指令与潜在动作三种表征统一互不兼容的动作空间,并采用基于课程学习的跨形态训练范式:先用潜在动作从无标注视频学习基础物理先验,再将其接地到末端执行器动作空间实现零样本部署。在DROID等挑战性环境中达到或超越单形态SOTA,并通过少样本适应进一步放大优势;所发布套件是目前覆盖动作条件空间与机器人形态最全面的视频世界模型,代码与模型全部开源。

原文 · arXiv:2608.27406

最先进的动作条件视频模型几乎都绑定在单一机器人形态上。这一约束是自我设限的:模型能学习的视频只占现存异构视频的极小部分,而无论动作主体是人类的手还是机器人的手臂,物体运动、碰撞与形变的物理规律并无二致。CLAP的出发点正是这一观察——时空动力学受普适物理定律支配,与执行者是谁无关——以及把这一洞察真正工程化所需的工作。

核心创新

CLAP要解决跨形态学习最根本的障碍:不同机器人平台的动作表征差异巨大,而人类视频里通常根本没有动作标注。其方案由两根支柱构成:

  • 统一动作空间——用三种互补的表征调和互不兼容的动作空间:末端执行器位姿、语言指令与潜在动作,三者互为补充、各补盲区。
  • 课程式跨形态学习——先在大量无标注视频上借助潜在动作学习基础物理先验,再把这些先验接地到末端执行器动作空间,从而实现对真实世界任务的零样本部署。

最终产出一个可跨人类、双臂平台、移动操作机器人与人形机器人数据联合训练的视频世界模型家族。

实验结果

  • DROID:在这一挑战性环境中,CLAP达到或超越单形态视频世界模型的SOTA水平。
  • 少样本适应:跨形态优势随少样本适应进一步叠加,为训练单形态视频世界模型开辟了新范式。
  • 覆盖面:发布套件横跨末端执行器、语言与潜在动作三种条件空间,覆盖DROID、Bridge、双臂YAM机器人与G1人形机器人——是迄今报道的最全面的动作条件视频世界模型套件。
  • 开源:全部代码与模型开源,项目主页为 omni-clap.github.io。

局限性

摘要将DROID结果表述为”达到或超越”,说明相对单形态模型的领先幅度并非在所有基准上一致。互联网规模的课程式跨形态训练意味着相当可观的数据与算力需求,文中未给出量化。零样本主张在动作可被干净地接地到末端执行器或语言空间时最强;在极端视觉新颖性或强接触动力学下的表现未有细节披露。

行业影响

跨形态世界模型改变了机器人学习的成本结构。一个用人类与机器人数据联合训练的视频世界模型,可以同时充当规划用的物理模拟器、策略预训练平台与合成数据生成器,覆盖人形机器人、机械臂与移动操作机器人——直接缓解当前基础模型开发中按形态单独采集数据的最大瓶颈。对通用机器人公司而言,这指向把无标注互联网视频当作一等训练资源,而不是可有可无的补充。