WM-LOCO:立足点受限地形上的世界模型增强人形机器人运动

· 编辑团队 estimated
人形机器人 运动控制 世界模型 腿足机器人 仿真到现实

WM-LOCO 联合训练循环世界模型与 PPO 策略,使人形机器人仅凭本体感觉与单张机载深度图即可穿越立足点受限地形——踏脚石、沟隙与窄台阶——全程无需显式落足标签。仿真中它在沟隙与踏脚石上成功通过(匹配基线完全失败);同一策略部署到实体 Unitree G1 后,在全部三类地形上平均成功率达 93.3%。

原文 · arXiv:2609.02542

立足点受限地形指可落脚的接触点稀疏、不连续或几何受限的地面——踏脚石、沟隙、窄台阶都属此类。在这种地形上,一次失足几乎没有任何纠正空间,因此主要依据眼前可见地形决定落脚点的策略极易失败。WM-LOCO 提出的问题是:如果策略能学会对未来一小段时间内观测与奖励的预测摘要,是否就能获得这类地形所必需的”预见”能力?

核心创新

  • 世界模型增强的控制——循环世界模型与 PPO 策略联合训练;世界模型以本体感觉与单张机载深度图为条件,产出预测性循环特征来引导策略。
  • 无需显式落足标签——落脚位置完全从数据中学习,不依赖人工标注的落足点监督,也不需要手写的落脚启发式。
  • 轻量感知——仅需机载本体感觉加一路深度流,不需要动捕系统、外部建图或任何特权地形信息。

实验结果

  • 仿真:在沟隙与踏脚石地形上,匹配基线完全失败,WM-LOCO 成功通过;在台阶上追平基线的成功率,同时步态效率更高、骨盆加速度更低。
  • 真机:同一策略直接部署到实体 Unitree G1,仅用机载本体感觉与单路深度流,在全部三类地形上平均成功率达到 93.3%。

局限性

真机验证集中于单一平台(Unitree G1)与三类地形,迁移到其它人形机器人与更丰富地形类型尚待证明;摘要未详述 sim-to-real 流程及其敏感性。预测性特征相比显式落足规划可解释性较弱;与基于感知的落足规划器的对比也未在摘要中展开。

行业影响

建筑巡检、工业设施维护与应急救援都需要腿足机器人在散落障碍、维修通道与狭窄栈道上行走——正是本文研究的地形类别。仅靠机载感知即可工作的策略降低了整机成本与部署复杂度;省去落足标注则简化了数据流水线,有利于规模化扩展。该方法同样适配四足等其它腿足平台,价值不限于人形形态。