AC-VLA:通过组合学习实现鲁棒的分布外动作执行
AC-VLA 是一个即插即用的组合学习框架,解决了 VLA 模型中的轨迹过拟合和感知捷径问题,在组合分布外任务上实现约 28% 的绝对提升,同时保持近乎完美的分布内性能。
原文 · arXiv:2607.15714视觉-语言-动作(VLA)模型在端到端机器人操作中表现出色,但当熟悉的子任务以未见过的组合方式出现时,它们难以应对分布外(OOD)泛化。AC-VLA 识别了两种相互强化的失效模式:轨迹过拟合(模型过度拟合整体轨迹模式而非组合性子技能语义)和感知捷径(动作 token 过度依赖腕部视角纹理而缺乏全局空间定位)。
核心创新。 AC-VLA 包含两个与架构无关的组件:(1) 组合学习模块,使用 LLM 驱动的指令分解器和本体感知轨迹对齐器生成密集的子任务监督信号,然后在完整演示和分解数据上进行混合训练;(2) 状态条件的不对称掩码策略,在夹爪闭合阶段抑制腕部视角输入,强制模型建立全局语义定位。两个组件无需架构修改即可集成到任何 VLA 主干中。
实验结果。 基于 pi_0.5 并在 LIBERO 和 LIBERO-OOD 基准上进行评估,AC-VLA 在组合 OOD 任务上实现了约 28% 的绝对提升,同时保持了近乎完美的分布内性能。这表明即插即用组件在不牺牲标称性能的前提下解决了泛化问题——这是实际部署的关键特性。
局限性。 组合模块依赖 LLM 进行指令分解,增加了延迟和成本。不对称掩码策略硬编码了夹爪状态,可能无法直接迁移到非抓取操作任务。评估仅限于 LIBERO 套件,在更多样化的机器人平台和任务分布上的验证将增强结论的普适性。
产业意义。 随着 VLA 模型(pi_0、Octo、RT-2)走向商业部署,AC-VLA 提供了一种无需重新训练的实用解决方案来提升其鲁棒性。在保持分布内性能的同时显著改善 OOD 泛化能力,这对任何在不同环境中部署基础模型策略的机器人公司都具有直接价值。