非抓取抛掷:一种强化学习视角

· 编辑团队 estimated
非抓取操作 机器人抛掷 强化学习 仿真到现实

本文用强化学习解决非抓取(无抓取)抛掷问题:策略显式利用滑移与滚动接触模式,直接优化关节空间轨迹,无需解析接触模型或自定义参数化。策略在仿真中达到数千构型 99% 的成功率并能泛化到未见物体;零样本部署到 UR5e 后,以接近物理极限的 5 m/s 末端速度,可将 790 g 重物与 20×20×28 cm 大物体抛至最远 350 cm、最高 180 cm 的目标,真实世界成功率 97%。

原文 · arXiv:2609.00771

抛掷能让机器人以极快速度转运物体,并把可达工作空间延伸到抓取范围之外。抓取式抛掷对可抓取的刚体很有效,但面对大、重或易变形的物体时就力不从心;非抓取(无抓取)抛掷——让物体在掌面上滑移、滚动后脱手——才是这类物体的出路。既有非抓取方法大多依赖带简化接触模型(如动态抓取假设)的基于模型优化和低维轨迹参数化,这既限制了求解质量,也压缩了可达工作空间。本文的思路是绕开显式建模,直接让强化学习自己学会利用接触。

核心创新

  • 接触模式即策略——RL 策略显式利用滑移与滚动两种接触模式完成释放,无需解析接触模型、无需自定义轨迹参数化。
  • 关节空间直接优化——MDP 被构造成一个以抛掷目标、物体模型与初始构型为条件的关节状态动力学系统,策略直接输出关节空间行为。
  • 两段式执行——离线以低控制率规划关节-jerk 轨迹,再上采样为平滑的高速率速度指令,兼顾规划质量与执行平滑性。
  • 面向 sim-to-real 的训练设计——通过最小 jerk 系统辨识缩小机器人动力学差距;训练不确定性感知策略以缓解物体建模误差,尤其是对动态摩擦系数的敏感。

实验结果

  • 仿真:在数千种构型上达到 99% 成功率,并能泛化到未见过的物体;敏感性分析显示对质量不确定性鲁棒,但对动态摩擦高度敏感——与滑移式释放机理一致。
  • 真实部署:零样本迁移到接近物理极限运行(末端速度 5 m/s)的 UR5e,可抛掷 790 g 重物与 20×20×28 cm 大物体,目标距离最远 350 cm、高度最高 180 cm。
  • 真实成功率:97%,且未经过任何真机微调。

局限性

对动态摩擦的高敏感性意味着部署前需要较好的摩擦辨识,物体材质变化较大时成功率可能回落;离线规划加低控制率上采样的框架限制了在线反应能力,难以应对动态目标;实验为单臂演示,未涉及失败案例的细粒度分析与长期磨损问题。

行业影响

“够不着就扔”在分拣与物流场景中直接转化为吞吐率与工位覆盖的提升:末端不闭合、不抓取,就能搬运重型与软包物体,减少了传送带与移动平台的投入。97% 的真实成功率与零样本迁移是工业落地友好的关键信号,抛掷可作为卸货、回收分拣、码垛辅助等环节的补充动作原语。对机械臂厂商而言,这类动态操作能力是把”拾放机器人”升级为”高速转运机器人”的可行技术路径。