代理策略引导:面向冻结通用策略的推理时任务适配

· 编辑团队 estimated
视觉-语言-动作模型 策略适配 推理时自适应 扩散策略 操作

Proxy Policy Steering(PPS,代理策略引导)是一种推理时适配方法,让冻结的通用机器人策略无需修改即可适应新任务。它训练两个轻量代理策略——一个「参考代理」建模冻结基座策略在目标任务观测上的行为,一个「任务代理」刻画任务监督带来的行为变化——用二者经校准的速度空间差值在每个去噪步引导基座采样器。由于基座策略从未被修改,其广泛能力得以完整保留。在8个真实世界与4个仿真操作任务上,PPS将当前最强的pi0.5基座策略的平均绝对成功率提升53%,在基座从未解决的任务上实现从零到一的突破,并全面优于LoRA微调、从零训练的专用策略、残差策略及此前的推理时引导方法。

原文 · arXiv:2609.09148

在大规模数据上训练的通用机器人策略具备广泛的操作先验,但把它们专项化到某个具体新任务仍是部署环节的最大瓶颈:微调有损于通用性,从零训练专用策略又浪费了先验。代理策略引导(Proxy Policy Steering, PPS)直击这一矛盾——它完全不改动基座策略,而是在推理时学会「如何引导」它。

核心创新

PPS训练两个轻量代理策略。参考代理在目标任务观测上模仿冻结基座策略的行为,建立「基座会怎么做」的基线;任务代理由参考代理初始化,学习在新任务监督下行为应当如何改变。二者速度预测的经校准差值构成一个残差,在每个去噪步引导冻结基座的采样器。由于适配过程只需要基座的前向速度预测,即便无法访问基座参数也可使用;又因为基座从未被修改,示范数据未曾覆盖的能力(如失败恢复)在推理时依然可用。

实验结果

  • 在8个真实世界与4个仿真操作任务上,将当前最强的pi0.5基座策略的平均绝对成功率提升53%
  • 在基座从未解决的任务上实现从零到一的成功率突破。
  • 全面优于LoRA微调、从零训练的专用策略、残差策略以及此前的推理时引导方法。
  • 论文识别并实证验证了「残差能够隔离任务监督引起的变化」所需的条件,而非混入基座的无关行为。

局限性

摘要中的结果基于pi0.5系列及相应基准,方法在其他通用架构上的扩展性尚未得到验证。该方法需要目标任务示范,且每个任务需额外训练两个代理策略;当参考代理无法完美刻画冻结基座行为时的计算开销与失败模式,摘要中未量化。引导效果依赖速度空间校准假设的成立。

行业影响

在不重训、甚至不接触基座模型的前提下,用少量示范把基础模型策略定制到客户具体任务——这正是部署团队需要的模式:既保护模型供应商的知识产权,又支持快速定制。这类「代理策略引导」有望显著降低通用操作策略走向生产的成本与风险,让一个基座模型同时服务仓储、厨房、工厂中大量定制化任务。