Ostrich:在可微动力学中以大步长穿越刚硬接触

· 编辑团队 estimated
可微仿真 刚体动力学 机器人学习 GPU 轨迹优化

Ostrich是一个GPU加速的可微刚体仿真器:它以大步长(约0.1秒)用非光滑牛顿迭代求解硬接触与摩擦,并借助隐函数定理对收敛残差求导,复用前向Schur补以每时间步O(1)内存计算伴随梯度。在跨越托盘障碍的真实机器人轨迹上,Ostrich以高达50倍于MuJoCo的时间步长保持与其相当的仿真到现实精度。其梯度能从随机初始化收敛,而MJX下降缓慢、Newton Semi-Implicit直接停滞;一次热启动迭代比MJX快211倍、比Semi-Implicit快4.7倍。Ostrich可在单张24 GB GPU上并行求导8192个世界,达到带检查点MJX优化吞吐的29倍。论文最后展示了在三角网格地形上、10秒时域内的基于梯度的轨迹优化。

原文 · arXiv:2609.08800

基于梯度的机器人学习——轨迹优化、强化学习、系统辨识——都依赖可微仿真器,但三个特性长期相互制约:仿真精度、梯度可靠性与单次迭代成本。MJX、Newton Semi-Implicit这类基于tape的引擎需要足够小的时间步才能让接触在数值上可控,且反传内存随轨迹长度线性增长。代理模型通过近似掉接触来约束内存,却让梯度丢失了优化所依赖的几何信息。Ostrich打破了这一三角矛盾。

核心创新

Ostrich是一个GPU加速的刚体仿真器,用非光滑牛顿迭代在大时间步(约0.1秒)下求解硬接触与摩擦。它不沿tape反传,而是借助隐函数定理对收敛后的接触残差求导,并复用前向Schur补以每时间步O(1)内存计算伴随梯度——内存与轨迹长度无关。大步长加恒定内存,首次让长时域、富含接触的梯度优化变得可行,而且可以直接处理三角网格地形,而非仅限于基本几何体。

实验结果

  • 在跨越托盘障碍的真实机器人轨迹上,以高达50倍于MuJoCo的时间步长保持与其相当的仿真到现实精度。
  • 梯度可从随机初始化收敛,而MJX下降缓慢、Newton Semi-Implicit停滞。
  • 一次热启动迭代比MJX快211倍、比Semi-Implicit快4.7倍。
  • 在单张24 GB GPU上并行求导8192个世界,吞吐达到带检查点MJX优化的29倍;无检查点时两个基线在远更少的世界数上即耗尽显存。
  • 在三角网格地形上、10秒时域内完成基于梯度的轨迹优化演示。

局限性

摘要聚焦于硬接触、刚体的接触求解区间(约0.1秒步长);柔性体与极高频率效应不在覆盖范围内。仿真到现实精度的锚点仅基于一条真实托盘障碍轨迹。与现有学习框架的集成情况,以及除MJX、Newton Semi-Implicit之外更完整的基准对比,需查阅全文确认。

行业影响

可微仿真是现代机器人学习的引擎室:抓取、 locomotion 与操作策略都要依靠穿越接触的梯度来训练与调优。Ostrich把大步长、恒定内存伴随梯度与GPU级并行世界数结合在一起,直接冲击了限制富含接触的仿真到现实流水线的那堵算力墙。对做长时域策略优化、系统辨识或轨迹优化的团队,以及对研发下一代「学习级」物理引擎的仿真厂商而言,这是地基级的基础设施。