Pigey:通过物理智能体编排弥合通用机器人的编排鸿沟

· Editorial Team estimated
VLA 编排 智能体机器人 规划 策略分解

Pigey 提出了一种闭环物理智能体编排器,能够将高层目标分解为子目标、调用低层 VLA 策略、跟踪执行结果并从失败中恢复——整个过程无需额外数据采集或微调。在 LIBERO-PRO 上达到 SOTA 的 4 倍(12.8%→53.3%),在真实机器人推理受限任务中将冻结策略从近乎零提升至 90% 的成功率。

原文 · arXiv:2607.21725

背景与问题

当前最先进的视觉-语言-动作(VLA)模型试图通过大规模预训练将感知、规划、成功检测、故障恢复和底层控制整合到一个单一策略中。尽管这些策略获得了出色的运动技能,但在需要子目标分解、结果验证或失败恢复等推理能力的任务上持续失败——而这些能力正是真实世界自主运行所必需的。

核心创新

Pigey 摒弃了单一模型的思路,将能力分解为两个组件:一个通用的语言条件策略/控制智能体,以及一个高层智能体管理器/编排器。编排器负责高层规划、将目标分解为可实现的子目标、调用底层运动技能、跟踪验证底层观测结果,并从失败中恢复。关键在于,它可以控制现有的 VLA 策略和参数化技能,无需任何额外数据采集或后训练。

关键成果

在 LIBERO-PRO 基准测试上,Pigey 将最先进水平提升了 4 倍以上(12.8% → 53.3%),且未使用任何任务特定微调。在真实机器人上,它将冻结 VLA 策略从近乎零成功率提升至 90% 以上。作者定义了”编排鸿沟”——即冻结运动技能单独运行与在智能体循环中运行之间的差距——并提供了一种系统性的弥合方法。

局限性

Pigey 依赖于底层存在可用的 VLA 或技能策略;它无法改善根本上不足的运动控制能力。编排器的规划和恢复逻辑目前使用手工设计的提示和规则,而非学习组件。在高度非结构化环境中扩展到数百个可能子目标的场景尚未验证。

行业意义

这项工作对任何部署 VLA 策略的组织具有直接的实用价值。与其收集大量任务特定数据来教会策略推理,Pigey 证明了一个智能体外壳可以解锁底层模型中已存在的推理能力。这大幅降低了在仓储、制造和服务场景中部署通用机器人的数据和计算门槛。编排鸿沟还提供了一种清晰的诊断方法,用于判断策略何时以及为何失败,从而指导针对性的改进。