GTA-2:基于具身任务轴的多VLM机器人操作技能合成框架

· 编辑团队 estimated
操作技能 多VLM 任务轴 零样本 机器人控制器

GTA-2是一个模块化多VLM框架,从可复用的、以物体为中心的任务轴组件出发,构建可执行、为具体任务量身定制的操作技能,而非端到端预测动作或组合固定原语。每项技能被表示为语义子任务,包含与任务相关的关键点与轴、控制器组合以及场景相关参数。四个专门化的VLM智能体分别负责:分解任务、构建抽象任务轴技能、分配控制器参数、并从RGB-D观测中落地所需视觉特征,从而实现零样本技能生成——无需任务专用示教、策略训练或微调。在14项真机操作任务上,平均零样本成功率达73.9%,比最强基线高出31.4个百分点;针对性的阶段级人工反馈可将平均成功率提升至90.7%。

原文 · arXiv:2609.09808

机器人操作通常被分解为行为或技能,但这些技能往往要么为特定任务预定义,要么被做得过于通用——覆盖面很广,却执行不好任何一件事。结果是规划器所推理的抽象层,与控制器真正需要的几何、控制和场景相关决策之间出现断层。端到端VLA策略通过直接预测动作绕过了这一断层,但既不透明又极度依赖数据。GTA-2选择了第三条路:让技能在构造上就是可执行的。

核心创新

GTA-2是一个模块化多VLM框架,把每项技能表示为由任务相关关键点与轴、控制器组合以及场景相关参数构成的语义子任务。这些子任务从可复用的、以物体为中心的任务轴组件装配而成,而非固定任务级原语。

工作被拆分为四个专门化的VLM智能体,各负责一个阶段:

  1. 分解任务。
  2. 构建抽象任务轴技能。
  3. 分配控制器参数。
  4. 从RGB-D观测中落地所需视觉特征。

这种「抽象到落地」的因子化正是零样本技能生成的关键——无需任务专用机器人示教、无需策略训练、无需微调。它同时让中间决策保持显式,因此人类可以给出针对性反馈,修正出错的那一个阶段,同时保留已经正确的组件。

实验结果

  • 14项真机操作任务上评测,对比一个VLA策略(π₀.₅)与两个Code-as-Policies基线(分别使用任务轴控制器或传统机器人原语)。
  • 平均零样本成功率73.9%,比最强基线高出31.4个百分点
  • 针对性精修后平均成功率提升至90.7%
  • 项目主页:**https://gta2-project.github.io/**。

局限性

框架依赖四个VLM智能体与一套人工设计的中间表示,因此成败取决于底层模型的可靠性以及任务轴模式本身的表达能力。摘要未按任务拆分成功或失败模式,也未报告延迟——而这对交互式使用很关键。由于视觉落地依赖RGB-D观测,在严重遮挡或透明/高反光物体下的表现尚未刻画。

行业影响

对多数工业操作任务而言,痛点不在策略的原始能力,而在「最后一公里」:把一句任务描述变成能在真实机械臂上正确运行的东西,并在某一阶段出错时能够修复。GTA-2显式的、阶段化的技能表示之所以有吸引力,恰恰因为它是可检查、可打补丁的——人可以修正出错阶段,而不必重训一个黑箱。相对强VLA基线31个百分点的零样本优势,加上精修后90.7%的成功率,说明结构化、可落地的技能合成在竞争力上不输端到端学习,同时更易诊断与部署。