GIFT:面向机器人操作的动作导向结构化监督引导中间特征训练
GIFT 针对"动作充分性缺口"——视觉-语言预训练提供的视觉丰富性与控制真正所需信息之间的错配——提出对中间特征施加三类与控制相关的结构监督:决定运动可行性的几何、编码指令相关实体的可供性、以及把指令 grounding 到任务相关区域的目标。该框架与架构无关,已在 VLA 策略、直接动作世界动作模型(WAM)与逆动力学 WAM 上实例化,且不改动各模型原有的动作表达。在零样本 LIBERO-Plus 上,GIFT 各变体以 79.6%/72.6%/87.8% 超出对应基线 4.6/12.6/5.2 分;在 RoboCasa 上以 61.4%/83.6%/82.3% 超出 12.6/9.0/8.4 分;在关节物体任务与受未见视觉/空间扰动的高精度真实操作中增益最大。
原文 · arXiv:2609.04193视觉-语言预训练与预测式世界建模为机器人策略提供了丰富的语义与动态视觉特征,但它们的原生目标可能遗漏控制真正依赖的物理与任务结构,同时保留了大量与控制无关的视觉冗余。GIFT 将这种错配命名为”动作充分性缺口”(action-sufficiency gap),并追问:引导中间特征保留与控制相关的结构,能否在不改动模型动作表达的前提下弥合这一缺口?
核心创新
- 三类控制相关结构——监督中间特征保留三类信息:决定运动可行性的几何、编码指令相关实体的可供性、以及把指令 grounding 到任务相关区域的目标。
- 训练期约束而非架构改造——几何对齐、可供性预测与目标区域重建被转化为训练损失,框架因此保持架构无关性。
- 跨家族实例化——分别应用于视觉-语言-动作(VLA)策略、直接动作世界动作模型(WAM)与逆动力学 WAM,保留各自原生的动作表达。
实验结果
- LIBERO-Plus 零样本迁移:GIFT-VLA、GIFT-WAM-Fast、GIFT-WAM-IDM 分别达到 79.6%、72.6%、87.8%,超出 StarVLA-OFT、Fast-WAM、Fast-WAM-IDM 4.6、12.6、5.2 分。
- RoboCasa:分别达到 61.4%、83.6%、82.3%,超出对应基线 12.6、9.0、8.4 分。
- 关节物体任务与受未见视觉/空间扰动的高精度真实操作上增益最大。
局限性
论文给出了跨基准与真实场景的证据,但更大规模的任务、模型与平台上的扩展性仍有待验证;可供性与目标监督需要标注或自动提取管线,其成本在摘要中未被完全量化;对比也仅限于各模型家族内报告的对应基线。
行业影响
对正在用 VLA 或 WAM 构建操作产品的团队而言,GIFT 提供了一条纯训练期配方:无需重设计动作头、不损失预训练先验,即可提升零样本迁移与对未见扰动的鲁棒性。由于增益集中在关节物体与高精度任务——正是真实部署中最棘手的部分——该方法有望成为弥合视觉基础模型与可靠物理操作之间差距的实用杠杆。