$\pi\mathbf{R}^2$: 具有反应能力与实时性的流策略

· Editorial Team estimated
机器人操作 流策略 反应式控制 VLA 实时

πR² 通过将条件输入拆分为快速本体感知通道(每控制周期更新)和异步更新的慢速视觉语言通道,并结合延迟自适应流调度,使基于大骨干网络的动作分块流策略获得反应能力和实时性。应用于 GR00T-N1.7 后,在 A5000 GPU 上以约25Hz频率重规划,真实场景任务成功率最高提升30%。

原文 · arXiv:2607.26055

背景

通用操作策略越来越多地采用基于大预训练骨干网络的动作分块流策略。这些分块在执行期间以开环方式运行,因此策略无法对执行途中到达的感觉输入做出反应。虽然更频繁地重规划可以恢复反应能力,但感知到动作的流水线——包含大型骨干网络和多个去噪步骤——速度过慢,在模型容量与闭环控制频率之间形成了根本性矛盾。

核心创新

πR² 通过两个关键思想使大型骨干网络流策略获得反应能力和实时性。首先,它将策略条件输入拆分为快速通道(本体感知,每个控制周期更新)和慢速通道(视觉语言特征,异步更新),使策略能够在一个动作分块内对关节角度和力做出反应,同时容忍稍过时的视觉信息。其次,延迟自适应的流调度将在途动作视为修复条件,每次调用仅用一个去噪步生成动作,使同一个训练好的模型能够适应不同硬件的延迟差异。

关键的是,πR² 仅需对现有架构做最小修改,可以从预训练策略进行微调。作者通过在真实 xArm6+XHand 平台上将其应用于 GR00T-N1.7 验证了这一点。

实验结果

πR² 的闭环重规划速度约为基础策略的4倍,在 A5000 GPU 上达到约25Hz,每40毫秒处理一次新观测。在仿真和真实世界操作任务中,相比于最强基线,其在仿真中成功率提升最高23%,在真实场景中提升最高30%。

局限性

双通道设计假设仅靠本体感知就足以在分块内进行纠正性反应。对于需要在分块内进行精细视觉反馈的任务(如视觉引导的插入),陈旧的视觉通道仍可能对性能造成天花板效应。该方法的验证限于单臂设置,双臂协调场景尚未探索。

行业影响

对于在物理机器人上部署大型 VLA 模型的团队,πR² 解决了闭环反应能力这一关键部署瓶颈。在商用 GPU(A5000)上以25Hz重规划使用 GR00T-N1.7 等大型骨干网络是一个实用的里程碑。由于对架构修改要求极小,现有已部署策略可以在不重新完整训练的情况下升级至 πR²,降低了实际机器人系统的采用门槛。