ZETA:桌面操作零样本跨本体 VLA 迁移的受控研究

· 编辑团队 estimated
视觉-语言-动作模型 跨本体迁移 零样本泛化 基准测试 操作

ZETA 是对 VLA(视觉-语言-动作)模型零样本跨本体迁移的首个受控研究:它区分“严格零样本”(目标本体完全不出现在训练数据中)与“预训练暴露式零样本”(目标本体仅在预训练中出现),并提出覆盖仿真与真机、含 14 个留出目标本体的评测基准。受控因素分析显示:局部末端执行器表征(+15 个百分点)、源本体多样性(+18)与辅助共训练(+7)均有助益;预训练中仅加入 5% 目标本体数据即可使目标本体进度提升 13.4 个百分点。

原文 · arXiv:2609.02546

机器人硬件快速迭代、任务专用数据采集成本高昂,零样本泛化到未见本体(新机型)因此成为通用视觉-语言-动作(VLA)模型的关键能力。但文献中既缺乏统一的零样本迁移定义,也缺少能把”本体变化”与任务、场景、评测协议的差异剥离开的受控设置,导致各家的结论难以互相比较。ZETA 用一套系统的受控框架来填补这一空白。

核心创新

  • 显式区分两种零样本——严格零样本迁移(目标本体不出现在任何训练数据中)与预训练暴露式零样本(目标本体仅在预训练阶段出现过)被明确分开,论文主张二者必须分别报告。
  • 受控评测基准——横跨仿真与真机验证、含 14 个留出目标本体的基准,把本体变化从任务、场景与协议等混淆因素中隔离出来。
  • 四因素受控分析——对状态-动作表征、预训练本体多样性、辅助共训练目标与目标本体暴露程度逐一进行受控考察。

实验结果

  • 局部末端执行器(EEF)状态-动作表征、源本体多样性与辅助共训练分别带来约 15、18 与 7 个百分点的跨本体迁移提升。
  • 预训练中仅加入 5% 的目标本体数据,平均目标本体进度即提升 13.4 个百分点——直接证明严格零样本与预训练暴露式零样本行为迥异,不应混为一谈。

局限性

受控设置限于固定桌面操作与两指夹爪;移动基座、灵巧手与长时程任务均未覆盖(作者也将其列为未来工作),因此此处测得的因素效应不宜盲目外推。真机验证虽然存在但规模有限,结论基于该基准自身协议得出。

行业影响

对构建通用 VLA 策略的团队,结论可直接落地为数据策略:扩大预训练阶段的本体多样性、优先采用局部 EEF 动作表征,并把新平台少量(约 5%)预训练数据视为高杠杆投入。同样重要的是评测纪律——厂商不应拿”预训练见过该机型”的结果宣传严格零样本能力。此类统一协议也为采购方横向比较各家商用机器人基础模型提供了更公平的基准。