DreamX-Phi 1.0:面向机器人操作的动作条件视频世界模型
DreamX-Phi 1.0是一种动作条件视频世界模型:给定观测帧、语言指令与动作序列(末端位姿与夹爪状态),预测未来的观测结果;通过逐臂SE(3)几何编码、深度分支与SAM3+V-JEPA物体一致性约束保证预测忠实度,在WorldArena 2.0挑战赛中获赛道一第一、赛道二第二。
原文 · arXiv:2608.13489视频世界模型——根据机器人计划执行的动作预测其下一步将看到什么的系统——正成为可扩展机器人学习的有力引擎:它们可以生成合成训练数据、支持基于想象的规划,并充当扎根于真实观测的仿真器。核心挑战在于”忠实度”:一段 rollout 可能看起来很逼真,却暗中移动了错误的手臂、丢失了被操作物体,或违反物理一致性。
核心创新
DreamX-Phi 1.0是一种面向机器人操作的动作条件视频世界模型。给定观测帧、语言指令和预设动作序列(末端执行器位姿与夹爪状态),它预测由此产生的未来观测。为确保预测忠实于指令运动,模型通过PRoPE式几何编码将逐臂SE(3)变换注入注意力机制,从而保持手臂身份与刚体运动结构。
由于仅靠动作控制无法完全约束场景几何与小尺度操作物体的演化,模型增加了轻量深度分支以建模场景级几何,并使用SAM3掩码配合冻结的V-JEPA教师模型,在抓取过程中维持物体一致性。分布匹配蒸馏将多步生成器压缩为少步学生模型,以实现高效部署。
实验结果
- WorldArena 2.0挑战赛赛道一第一名
- WorldArena 2.0挑战赛赛道二第二名
- 通过分布匹配蒸馏得到少步学生模型,支持高效部署
- 模型与代码将公开发布
局限性
摘要报告的是竞赛名次而非详细的预测保真度量化评估,预印本中暂未呈现各指标相对基线的精度对比。WorldArena结果反映特定基准设定,跨未见场景、不同形态与长时程的泛化能力仍有待验证。架构依赖较强的外部组件(SAM3、V-JEPA、PRoPE式编码),在实际集成上存在一定复杂度。
行业影响
动作条件世界模型正处于产业界推动可扩展机器人数据的核心位置:它们有望将少量真实演示转化为大规模、多样化的合成训练语料,并为策略提供用于规划与重规划的”心理模拟”。DreamX-Phi的竞赛成绩表明,忠实且与动作一致的视频预测正变得可行,而少步蒸馏解决了此类模型长期被挡在实时循环之外的推理成本问题。对于构建操作任务数据引擎与基础策略的团队而言,这一方向与数据生成和基于模型的规划均直接相关。