Learning Reusable Hybrid Motion Priors for Humanoid Locomotion from Motion Imitation: 从运动模仿学习可复用的混合运动先验用于人形机器人 locomotion
· Editorial Team estimated
humanoid locomotion motion imitation reinforcement learning
提出三阶段流水线将运动模仿技能转化为可复用的混合运动先验(HMP)。先训练专家策略模仿人类动作捕捉数据,再蒸馏为冻结的RVQ码本架构,最后训练任务级策略通过选择离散码本条目实现 locomotion。速度追踪策略成功部署到真实Unitree G1机器人上。码本结构呈现可解释的层次化步态模式。
原文 · arXiv:2607.24083背景
强化学习可以产生鲁棒的人形机器人控制器,但每个新任务通常需要独立的策略训练和奖励设计。运动模仿通过训练策略跟踪重定向的人体运动来提供替代的运动技能来源,但生成的控制器仍然是参考轨迹跟踪器,不能直接用作任务策略。
核心创新
本文提出三阶段流水线,将运动模仿技能转化为可复用的混合运动先验(Hybrid Motion Prior, HMP):
- 专家训练:训练策略模仿重定向的人体动作捕捉片段
- 知识蒸馏:将专家蒸馏为冻结架构,包含本体感受编码器、残差向量量化(RVQ)码本和动作解码器
- 任务训练:训练任务级策略通过选择离散码本条目解决 locomotion 任务,HMP保持冻结
关键技术亮点:
- RVQ码本结构中,活跃的RVQ阶段数量调节可用步态模式,呈现可解释的层次化结构
- 使用”旋转技巧”(rotation trick)训练码本,改善潜在空间组织,减少下游跌倒
实验结果
- 在仿真中评估了速度追踪、点目标导航和跌倒恢复速度追踪三种任务
- 速度追踪策略成功部署到真实Unitree G1机器人上
- 蒸馏过程保留了专家的追踪行为
- 旋转技巧训练的码本在潜在组织上优于标准直通估计器
局限性
当前方法仅在Unitree G1一种平台上进行了实物验证。码本中存储的运动先验质量取决于动作捕捉数据的多样性和质量。极端地形和复杂环境中的泛化能力尚未充分验证。
行业影响
人形机器人是当前机器人行业最热门的赛道之一。本文提出的可复用运动先验(HMP)架构可以显著降低人形机器人新技能的开发成本——不再需要为每个任务训练独立策略,而是共享一个冻结的运动码本。这种”一次训练、多任务复用”的范式对宇树科技、特斯拉Optimus等人形机器人平台具有直接参考价值。机器人公司可以基于少量动作捕捉数据训练通用运动先验,然后快速适配不同应用场景。