XPACE:把世界模型与动作模型合成一个模型,用异构经验训练人形机器人

· Editorial Team estimated
世界模型 世界-动作模型 人形机器人 视频预测 异构经验 策略自改进

本文提出 XPACE,一个把世界模型与世界-动作模型合二为一的统一具身世界模型:它既能联合预测可执行的机器人动作与未来视频,也能作为模拟器预测给定动作的视觉后果。作者用无动作标注的视频学习视觉动力学,用带动作标注的人类与机器人演示联合学习视频与动作预测,并采用由粗到细的课程逐步把训练重心转向机器人控制,从而使策略学到机器人演示未覆盖的行为。该模型还用自身模拟器合成偏离—恢复轨迹来补充监督,在 XPENG IRON 人形机器人上提升了鲁棒性、跨任务技能迁移与真实任务完成率。

原文 · arXiv:2609.17372

通用机器人需要同时具备三件事:从多样经验中学习、选择合适的动作、并预判动作会如何改变世界。现有做法往往把它们拆开——策略网络负责动作,世界模型或视频预测模型负责想象未来,两者各训各的。结果是:数量最大的经验来源(无动作标注的人类视频)难以直接进入策略训练;而模型即便能想象,也很难把想象转化为策略改进的监督信号。

核心创新

XPACE 的思路是把两者做成一个模型。它是一个统一的具身世界模型,同时承担两种角色:

  • 世界-动作模型:联合预测可执行的机器人动作与未来视频;
  • 世界模拟器:在给定动作的条件下预测其视觉后果。

关键设计是策略与模拟器共享同一个视频骨干。训练时,无动作标注的视频被用来学习视觉动力学,带标注的人类与机器人演示则用来联合学习视频预测与动作预测。作者进一步引入由粗到细的训练课程:逐步把训练重心从通用视觉动力学转向机器人控制,同时保留人类经验,使策略能够学到机器人演示之外的行为。

第三块创新是用模拟器给策略造监督。模型先把模拟器适配到自己生成的上下文,再围绕专家演示合成偏离—恢复轨迹,最后用筛选后的恢复样本微调策略。

实验结果

  • XPENG 的 IRON 人形机器人上开展实验:异构训练提升了鲁棒性,并实现了把人类视频中学到的技能迁移到机器人演示未覆盖的任务
  • 由模型自身模拟器生成的恢复数据进一步提升了真实世界任务完成率
  • 摘要强调这两项结论共同说明「联合世界建模与动作建模」可以把异构经验学习与模拟驱动的策略自改进打通。

局限性

摘要没有报告任何量化结果:既没有任务数量与成功率,也没有对比基线。共享骨干的具体结构、策略头与模拟器头之间的信息隔离方式未展开。用模型自身生成的上下文去适配模拟器、再合成恢复轨迹,这一步的误差累积风险没有讨论。摘要同样未说明模型规模、训练数据量、推理硬件,也未提及是否开源。

行业影响

人形机器人的数据瓶颈从不是缺视频,而是缺带动作标注的数据。XPACE 把人类视频当视觉动力学语料、把少量机器人演示当动作监督,等于给出了一个把两池数据焊接起来的架构模板;而「用自身模拟器造恢复数据」则回应了另一个现实痛点——真实机器人很难大量采到失败与纠偏样本,这恰恰是策略鲁棒性最需要的部分。对正在搭建人形数据飞轮的团队而言,这套结构提供了一条把人类视频、机器人演示与自生成数据串成闭环的可行路线。