Beyond Imitation:基于离策略Q-规划的自改进机器人策略

· 编辑团队 estimated
机器人学习 行为克隆 强化学习 双臂操作 自改进

Q-Planning为大规模视觉运动行为克隆策略配备一个小型离策略Q函数,推理时用Q加权选择动作,在线自改进时只微调Q函数而不动策略权重。在LIBERO与双臂RoboTwin上,十轮自改进迭代提升所有基准分数(LIBERO-10从93%升至99%,RoboTwin从83.8%升至91.4%);在两个接触密集的双臂真实机器人任务中,同一循环仅凭部署rollout即可自改进(叠杯从40%升至90%、插钱包从25%升至80%),而仅用成功rollout的SFT停滞在55%和30%。

原文 · arXiv:2608.21204

行为克隆(BC)推动了机器人操作领域近年来的大部分进展,但它无法从自身错误中学习:策略一旦失败,就只能等待人工补充演示。强化学习微调本可提供自改进路径,但将其扩展到支撑现代机器人策略的数十亿参数模型极其困难。Q-Planning正是针对这一不对称性提出的解决方案。

核心创新

核心洞察在于:Q函数估计的是价值而非模仿动作,因此它既能用与BC策略相同的成功演示训练,又能在部署后吸收成功与失败两类rollout——这是BC不具备的能力。Q-Planning为大型视觉运动BC策略配备一个小型离策略Q函数,并从两个方向利用这种不对称性:

  • 推理时的价值引导动作选择:对BC的多次动作采样做单步Q加权平均,用价值感知的选择替代机械模仿。
  • 在线自改进:只微调Q函数以吸收新rollout,BC权重完全冻结,既避免灾难性遗忘,也绕开全模型RL微调的不稳定性。

由于不训练任何辅助actor,即使底层策略规模巨大,该方法依然廉价且稳定。

实验结果

  • LIBERO-10在十轮自改进迭代中从93%升至99%;RoboTwin从83.8%升至91.4%。
  • 在接近天花板的任务套件(LIBERO-Object、LIBERO-Goal)上成功回合耗时缩短。
  • 真实双臂机器人、无人工干预:叠杯从40%升至90%、插钱包从25%升至80%(五轮迭代),而仅用成功rollout的SFT停滞在55%和30%。
  • 在相同的在线预算下,Q-Planning是Best-of-N、过滤SFT、IBRL、DSRL、DAWR中唯一能从失败中稳定改进且无需训练辅助actor的方法。

局限性

真实世界证据仅覆盖两个接触密集的双臂任务,仿真证据限于LIBERO与RoboTwin套件,任务广度尚未充分验证。单步Q加权选择是务实的近似而非完整前瞻,摘要也未分析多轮部署后Q估计误差的累积情况。此外,该方法继承基础BC策略对演示质量的依赖。

行业影响

让机器人仅凭自身部署数据即可自改进、无需额外人工演示,直击现代机器人学习最大的成本痛点——数据采集。对在仓储、装配或家庭场景中交付VLA式操作产品的团队而言,只微调一个小型Q函数的循环可以在机队硬件上实际运行,价值引导选择也无需重训策略即可启用。若该结论能在更多任务上成立,它将指向一条可信的机器人持续改进生产路径。