学习自适应步态时序的容错运动控制
本文提出一种面向执行器断电故障的深度强化学习容错四足运动控制方法。非对称 actor-critic 架构让 critic 在训练时使用特权信息,而 actor 仅从本体感觉观测中重建对应的潜在表征,并通过潜在对齐损失保证两者一致。动作空间被扩充了一个可学习的步态频率参数,使策略能够根据地形变化与执行器退化自适应调整步态时序,而无需预定义故障腿策略。该方法在崎岖地形的高保真仿真与 68 kg 四足机器人的平地真实实验中均得到验证。
原文 · arXiv:2608.07328背景
硬件故障是足式机器人在实际作业中的常态,要求机器人迅速重组协调关系与步态时序以维持稳定与机动能力。这一问题在大型四足机器人上尤为严峻:更大的质量与更紧的执行器限制,排除了小型平台常用的激进高频补偿策略。一台 68 kg 的机器人若腿部执行器断电,不能靠加快跳跃来补救,而必须仅凭本体感觉反馈,在实时中自行重组步态结构。
核心创新
该方法是在执行器断电下实现容错运动控制的深度强化学习方案,建立在三个要点之上。其一,非对称 actor-critic 架构:训练时 critic 可获取特权信息,而 actor 从本体感觉观测中学习重建与之匹配的潜在表征,并通过潜在对齐损失保证二者一致。其二,动作空间被扩充了一个可学习的步态频率参数,策略可随地形与执行器退化自适应调整步态时序,而无需任何预定义的故障腿策略。其三,方法在高保真仿真中训练,以覆盖策略鲁棒性所需的广泛故障场景。
实验结果
该方法在崎岖地形的高保真仿真以及 68 kg 四足机器人的平地真实实验中均得到验证。潜在对齐训练与自适应步态时序的结合,使机器人在执行器断电下仍能保持稳定与机动——这一区间内,固定步态策略通常会急剧退化。在整机平台上完成真机验证,使本研究区别于仅停留在仿真层面的容错研究。
局限性
真实实验目前仅限于平地,崎岖地形的容错能力仅在仿真中验证。实验聚焦于执行器断电,尚未覆盖传感器失效或部分执行器退化等其他故障模式。方法仅在单一 68 kg 平台上评测,在更轻或更重机器人上的扩展性尚未确立。
行业影响
容错能力是”演示中能跑的足式机器人”与”能在矿山、仓库或灾害现场撑过一个班次的足式机器人”之间的分水岭。执行器故障是野外四足机器人最常见也最危险的故障模式之一,在执行器断电后维持机动能力,可直接降低足式机器人车队的停机时间与维护成本。自适应步态时序的设计同样值得关注:它不需要任何针对特定故障的预设策略,从而简化了不同平台与故障场景下的部署。