GloVLA:让几何负责移动、局部VLA负责交互——非结构化环境下的稳健以物为中心操作

· 编辑团队 estimated
VLA 操作 以物为中心 机器人学习 LIBERO

GloVLA是一种混合式框架,将以物为中心的操作显式拆分为两个互补阶段:几何传输控制器负责把末端执行器移动到交互为中心的交接区域,局部视觉-语言-动作(VLA)策略只处理短时程、重接触的交互阶段。该方法与模型无关,可无需额外演示地集成不同VLA骨干,且不改变动作空间或成功判据。在杂乱、干扰物、光照变化、视觉偏移与遮挡等挑战条件下,全轨迹GR00T N1.6的平均成功率降至20.9%,而GloVLA仍保持88.5%;在真实UR10e机械臂上,整体成功率从35.6%提升到90.0%,平均推理时间缩短一半以上。

原文 · arXiv:2609.06256

端到端视觉-语言-动作(VLA)策略若同时承担长距离末端传输与短时程、重接触交互两类任务,往往既低效又脆弱:轻微的视觉偏移、干扰物、杂乱场景、遮挡或不佳的初始夹爪位姿,都可能把策略推出其训练所覆盖的局部状态分布,导致任务失败。GloVLA的核心观察是:这两个阶段的失效模式截然不同,不应由单个大一统策略一并解决。

核心创新

GloVLA是模型无关的混合框架,把以物为中心的操作显式分为两个互补阶段。几何传输控制器负责把末端执行器移动到以交互为中心的交接区域,处理长距离、以几何为主体的运动;局部VLA策略只负责短时程、重接触的交互阶段。该框架可接入不同VLA骨干,无需额外示范数据,也无需改动动作空间或成功判据——它更像一种轻量级的架构性改造,而非重新训练的方案。

实验结果

  • 在标准LIBERO与LIBERO-Plus Object任务,以及新提出的包含杂乱、干扰物、光照变化、视觉偏移与遮挡的LIBERO-Challenge基准上,GloVLA相较完整端到端执行提升了任务成功率。
  • 在挑战条件下,全轨迹GR00T N1.6执行的平均成功率降至20.9%,而GloVLA保持88.5%。
  • 在真实UR10e机械臂上,整体成功率从35.6%提升到90.0%,平均推理时间缩短一半以上。

局限性

摘要未完整交代LIBERO-Challenge数字背后的评测协议,且即便加入各类扰动,LIBERO系列仍是桌面尺度任务。传输/交互两阶段拆分假设以物为中心的任务能被干净地划分为几何阶段与交互阶段,对高度可变形或关节类物体可能并不自然。具体逐任务分解及所测试的VLA骨干清单需要阅读全文确认。

行业影响

VLA策略真正进入产线,就必须直面GloVLA所针对的非结构化条件:光照变化、杂乱、干扰物与不完美的初始位姿。真实机械臂成功率近乎翻倍、推理成本减半的方案,对当前在现场屡屡失灵的码垛、分拣、装配等端到端应用有直接价值。由于GloVLA模型无关且无需新增演示,集成商可以在现有VLA栈上直接加装,而不必重新采集数据或从零训练。