Pelican-Sim 1.0:面向具身智能的通用世界模型仿真器

· Editorial Team estimated
世界模型 具身智能 统一动作空间 混合专家 扩散蒸馏 轨迹生成

Pelican-Sim 1.0 是一个面向具身智能的通用世界模型仿真器:它根据视觉上下文与机器人动作预测未来观测,以支撑下游的学习与决策。模型包含四项关键设计——覆盖主流本体的 28 维统一动作空间、用 URDF 与相机渲染的动作视频打通动作与像素的动作-视觉注入、用于吸收异构动力学并缓解模态冲突的稀疏混合专家层,以及借助因果适配与少步蒸馏得到的四步自回归仿真器。作者在约一百万条真实与仿真轨迹上训练,并在多个数据集上取得视频质量与动作可控性的显著提升;在 RoboTwin 的四个下游应用中,每任务仅需补充 500 条生成轨迹即可把策略成功率从 70% 提升到 93%。

原文 · arXiv:2609.12036

具身智能的训练与评测长期受制于真实数据成本:真机采集成规模有限,而策略评估又必须反复回到真实环境。世界模型被寄予厚望——如果模型能根据视觉上下文与动作准确预测未来观测,就能承担数据生成与策略评测两块工作。

核心创新

Pelican-Sim 1.0 是一份技术报告式的通用世界模型仿真器,其设计围绕四个要点展开:

  1. 统一动作表示:使用一个 28 维动作值空间覆盖大多数主流本体,使同一个模型对异构设备都有效,不必为每种机器人单独建模。
  2. 动作-视觉注入:用 URDF 与相机渲染的动作视频在动作与像素之间架桥,跨本体、场景与任务的可控性明显更好(相比其他融合基线 PSNR 提升 0.904)。
  3. 稀疏混合专家(MoE):稀疏 MoE 层为异构动力学提供容量,并吸收动作模态,从而缓解模态间冲突(相比稠密骨干 FVD 改善 6.530)。
  4. 高效 rollout 生成:通过因果适配与少步蒸馏得到四步自回归仿真器,相比 35 步模型获得 5.67 倍加速

实验结果

  • 训练数据规模约为一百万条真实与仿真轨迹
  • 视频质量与动作可控性大幅提升:PSNR 相比最强评测基线在 AgiBotWorld Beta 上 +4.636、RoboMIND 上 +2.080、RoboTwin 上 +10.343;在 RoboTwin 上适配后的 EWMBench DYN 分数提升 0.426
  • 在 RoboTwin 上的四个下游应用均告成功:每个任务在 50 条演示上补充 500 条生成轨迹,即可把策略成功率从 70% 提升到 93%;策略评估在五个检查点上达到 0.994 的皮尔逊相关;动作选择与策略改进分别获得 47.7% 与 20.3% 的相对成功率增益
  • 在轨迹、场景、物体、本体与视角偏移下展示了定性泛化能力。

局限性

这是技术报告,摘要中没有任何真机部署或闭环实机实验:证据集中在仿真数据集与基准上,而 RoboTwin 上 10.343 的 PSNR 增量也提示不同数据域的收益差异很大,泛化边界尚不清楚。“覆盖大多数主流本体”的 28 维动作空间并未说明未覆盖哪些本体与任务类型,跨本体质控缺少量化指标。四项下游用途全部在 RoboTwin 生态内验证,能否迁移到其他仿真器或真实数据管线仍未证明;摘要也未提及代码、权重或数据是否公开。

行业影响

世界模型最现实的产业切口是替代昂贵的数据采集与真机评测。以 0.994 的相关性代替部分真机策略评估,可以直接压缩迭代周期与实验成本;而”500 条生成轨迹把成功率从 70% 提到 93%“说明它在数据增强上已具备可用性——对数据稀缺的长尾任务尤其有吸引力。四步自回归带来的 5.67 倍加速则决定了这类模型能否进入训练循环而非离线批处理。同一模型跨本体生效这一点,也意味着机器人厂商不必为每种机型训练一套世界模型。