Size Doesn't Matter:材料状态强化学习让挖掘机学会可迁移的土壤作业

· Editorial Team estimated
挖掘机 强化学习 土方作业 材料点法仿真 工程机械自主化 仿真到现实

本文把土方作业的自主控制建模为材料状态条件化的强化学习问题,在 GPU 并行的材料点法(MPM)颗粒仿真中训练策略,使其能依据土壤形状与密实度等状态选用铲斗的不同接触面,把土体在铲斗内外双向搬运。策略在归一化末端执行器空间中学习,并通过标定后的机器接口跨机型部署:同一组权重既驱动 11.5 吨液压挖掘机,也驱动 500 克桌面机器人。实机测试中系统自主修筑了一条 42 米长、2.1 米高的土堤,45 分钟内连续完成 201 次策略动作,全程无需人工干预,推进速度与熟练操作员持平。

原文 · arXiv:2609.12677

土方作业——开挖、回填、修筑土堤——本质上是对可变形土壤的反复搬运。熟练操作员会调动铲斗的所有接触面来完成这些动作,而现有自主系统大多只覆盖”开挖”与”卸料”两个环节,并且依赖启发式模型,几乎不引入土壤力学。

核心创新

本文在GPU 并行的材料点法(MPM)颗粒仿真中用强化学习训练控制器,并把材料状态(如土壤的形状与密实度)作为条件输入。由此学到的技能不再局限于”把土挖起来”,而是能使用铲斗的多个接触面,并把土体在铲斗内外双向搬运——这正是回填、压实、修坡等工序所必需的。

为了让学到的策略不绑定单一机器,作者让策略在归一化的末端执行器空间中运行,再通过一套标定的机器接口部署。于是同一组学习到的权重可以跨机型复用,而无需为每台设备重新训练。

实验结果

  • 11.5 吨液压挖掘机500 克桌面机器人上验证了上述标定迁移。
  • 自主修筑一条 42 米长、2.1 米高的土堤,45 分钟内完成 201 次独立策略动作,全程无失败、无重试、无操作员介入。
  • 与专家操作员的直接对比中,自主控制器的推进速度与专家持平,且堆出的土堤更高、更一致
  • 另有回填与压实实验,定性地展示了材料状态感知能力与跨机型迁移效果。

局限性

摘要是定量的工程报告,但没有给出仿真与真机之间的成功率对比、适用的土壤参数范围,以及不同土质与含水率下的泛化表现。与操作员的比较未说明人数与重复次数,因此”更高、更一致”缺少统计层面的支撑。MPM 仿真的计算开销较大,而摩擦、黏附、颗粒破碎等仿真到现实的落差仍是主要风险;摘要未提及代码、数据或硬件清单是否公开。

行业影响

对建筑与矿业来说,这条路线指向**「用仿真训练可复用的土方技能」**。一旦策略与机型解耦,工地更换设备时不必重新采数据、重新训练,部署成本会显著下降。更重要的是,它把自主系统从”只会挖和倒”扩展到回填、压实、修坡等完整工序,是把重型工程机械真正纳入自主作业链条的关键一步——而这类设备恰恰是人力短缺最严重、单机价值最高的环节之一。