面向颗粒地形的自适应人形机器人运动学习
本文基于三维阻力理论(3D RFT)构建了物理上可靠的颗粒接触模型,并高效仿真颗粒地形用于强化学习训练,以能刻画下陷与切向拖曳的物理精确侵入动力学,取代刚体接触模型与启发式颗粒模型。控制器通过教师—学生强化学习训练,并用变分自编码器把地形信息压缩为紧凑隐变量,实现零样本地形识别与自适应。基于MPM与NVIDIA Newton的仿真研究表明方法可泛化到未见颗粒地形、成功率显著高于基线;在玄武岩、干沙与海滩沙等多种真实颗粒地形上的硬件实验,作者称是首次实现真实颗粒地形上的敏捷人形机器人运动。
原文 · arXiv:2609.10286人形机器人已经学会在岩石、碎石和台阶上行走,但颗粒介质——沙地、泥土、海滩、玄武岩——仍是一道顽固的关卡。难点不在感知或规划,而在接触物理:颗粒地面受压会屈服,脚会下陷、拖曳并改变基底形态。大多数运动策略所训练的刚体接触仿真器,把足地交互建模为硬约束;简化颗粒模型则额外拼接启发式的切向力。两者都无法复现真实沙地上占主导地位的下陷动力学,这正是仿真中稳健的策略一踏上松软地面就失灵的原因。
核心创新
本文用物理取代启发式。其接触求解器建立在**三维阻力理论(3D RFT)**之上——一种颗粒侵入的连续介质模型,它把下陷深度与切向拖曳表示为足部速度与朝向的函数。该求解器被嵌入一条足够高效的仿真流水线中,从而可以驱动强化学习训练,让策略面对物理精确的颗粒力,而非临时拼凑的近似力。
在接触模型之上,作者通过教师—学生强化学习训练了地形自适应运动控制器。变分自编码器把地形信息编码为紧凑的隐表示,为学生策略提供了关于脚下材质的低维把手。该隐变量支持零样本地形识别与自适应——控制器能够推断并适应训练中从未见过的地形。
实验结果
- 基于物质点法(MPM)与NVIDIA Newton的仿真研究表明,方法可泛化到未见颗粒地形,成功率显著高于基线。
- 所学控制器展现出零样本地形识别与自适应能力。
- 硬件实验覆盖多种真实颗粒地形:玄武岩、干沙、海滩沙。
- 作者称这是首次在真实颗粒地形上实现敏捷人形机器人运动。
局限性
摘要未给出各地形上的成功率、能耗或硬件行走速度,因此相对刚体接触基线在真实地面上的优势幅度难以仅凭摘要量化。基于3D RFT的颗粒接触建模对干燥、无黏性介质最有说服力;潮湿、有黏性或覆被植被的地面未涉及。训练依赖MPM仿真器,其计算开销高于刚体接触引擎,且该抽象未必能迁移到所有颗粒材料。
行业影响
腿式机器人正被推向实验室之外的工地、农田、海滩与灾害现场——而这些场景几乎都覆盖着松散材料。只能在硬地面工作的策略,等于一走到工地边缘就停摆。本文让颗粒接触变得可物理训练,并学习出无需事先接触即可自适应的地形条件隐变量,把人形移动能力拓展到恰好是商业落地所瞄准的非结构化环境。对研发野外人形机器人的团队,或打造「学习级」颗粒地形仿真的厂商而言,这是一次有意义的能力跃升。