StableMimic:人形机器人动作跟踪的平滑类人跌倒恢复——在跟踪分布之外学习结构化倒地后行为
StableMimic 是一个在名义跟踪分布之外训练的统一人形机器人动作跟踪策略,能够在跌倒后自主恢复。围绕多个人类起身参考的扰动重置暴露了俯卧、仰卧与失衡等状态;专用的跟踪与恢复专家由本体感觉门控持续混合,隐藏后继状态目标则在不向部署策略暴露参考身份的前提下塑造类人恢复行为。在重定向后的 LAFAN1 舞蹈子集上,它在五种方法中取得全部四项跟踪指标的最低误差;在匹配的推倒实验中 100/100 次成功恢复,并在真实宇树 G1 机器人上得到验证。
原文 · arXiv:2608.02385背景
人形机器人动作跟踪器在所学跟踪分布范围内表现可靠,但跌倒会将机器人带入低矮、接触密集的状态,此时前进指令暂时无法执行。仅靠跟踪的策略在这些状态下可能追逐不可行的参考轨迹,产生快速、大幅度的肢体修正,增加对机器人自身及周围环境的风险。此类状态下的恢复通常需要外部干预或单独的跌倒恢复模块。
核心创新
StableMimic 是一个在名义跟踪分布之外训练的统一跟踪器。围绕多个人类起身参考的扰动重置,使策略暴露于俯卧、仰卧、失衡及中间地面接触状态,从而塑造出能引导机器人返回可跟踪区域的结构化恢复行为。由于跟踪与恢复处于截然不同的状态-动作分布,StableMimic 为两种模式各配备专用专家,并由一个本体感觉门控持续混合二者的动作输出。隐藏后继状态目标使策略学会人类参考形态的恢复行为,却无需向部署的 Actor 暴露参考身份或相位信息——部署时不需要起身参考、恢复指令、轨迹检索或外部策略切换。
实验结果
在完整的重定向 LAFAN1 舞蹈子集上,StableMimic 在五种方法中取得全部四项跟踪指标的最低误差。在每种方法各 100 次匹配推倒实验中,它以 100/100 的成功率完成恢复,并在七项倒地后运动与负载指标中的六项上取得最优值,表明该方案在该协议下有助于提升交互安全性。在真实宇树 G1 上的舞蹈与站立参考部署则定性展示了有界肢体运动、自主恢复与指令恢复执行。
局限性
定量评测集中于重定向的 LAFAN1 舞蹈子集与推倒实验协议,其他跌倒类型与动作库上的表现尚未验证。真实硬件验证仅限于宇树 G1 平台,向其他形态或非结构化的真实跌倒场景的泛化能力仍有待证明。
行业影响
在人、仓库或公共空间附近运行的人形机器人,跌倒后恢复能力是决定性的安全要求。一个无需起身参考、恢复指令或外部策略切换即可自主恢复的策略,能显著减少操作员干预,并降低连续运行的风险水平。恢复过程中强调有界肢体运动,直接关系到与周围人员发生碰撞时的安全性,对面向产品化的人形机器人安全验证与部署决策具有现实意义。