Ego2Robot:从第一视角人类数据规模化合成机器人数据

· Editorial Team estimated
机器人数据 第一视角视频 数据合成 VLA预训练 动作重定向

Ego2Robot 是一条可扩展的数据合成流水线,通过动作重定向、机械臂视觉合成与多级质量筛选,将第一视角人类操作视频转化为机器人训练数据,产出横跨 15 种机器人形态、共计 18,561 小时的训练数据——这是迄今规模最大的 ego-to-robot 数据集。在合成数据与真实机器人数据上的联合预训练,能在视觉外观、场景布局、本体形态与任务语义等多个扰动维度上持续提升分布外泛化能力,并在真实机器人部署中得到验证。

原文 · arXiv:2608.02580

背景

学习可泛化的机器人操作策略依赖大规模、多样化的示教数据,而在真实硬件上采集数据既昂贵又缓慢。第一视角(egocentric)人类操作视频在场景与任务多样性上极为丰富,且在互联网规模上几乎是免费的。已有工作表明,将这类视频重定向并渲染成机器人格式的数据,可以在小规模上训练出有效的单任务策略;但这一路线能否在规模化层面为视觉-语言-动作(VLA)模型带来预训练收益,此前尚属空白。

核心创新

Ego2Robot 是一条可扩展流水线,通过动作重定向、机械臂视觉合成与多级质量筛选三个环节,将第一视角人类操作视频转化为机器人训练数据。它同时支持精选数据集与野外视频,产出了横跨 15 种机器人形态、共 18,561 小时的机器人训练数据——这是迄今规模最大的 ego-to-robot 数据集。为严谨评估泛化性,作者扩展了 RoboTwin2.0,引入覆盖视觉外观、场景布局、本体形态与任务语义的解耦扰动轴。

实验结果

在 Ego2Robot 合成数据与真实机器人数据上的联合预训练,能在多种扰动类型上持续提升分布外泛化能力。这些收益不仅在仿真中得到验证,也在真实机器人部署上得到确认,说明第一视角人类视频可以成为 VLA 策略实际可用的预训练数据来源,而不仅仅是小规模场景下的技巧。

局限性

合成数据的质量仍受限于底层重定向与视觉合成的水平,多级筛选也无法完全消除野外视频中的伪影。评测集中于操作类任务,结论未必能直接迁移到其他本体类别。另外,论文未详细说明合成与筛选 18,561 小时数据所需的算力成本,这对需要评估投入产出的团队而言是一个关键变量。

行业影响

第一视角人类视频是最大的未充分开发的操作示教来源之一,将其转化为机器人格式训练数据的流水线,有望缓解当前制约 VLA 预训练的遥操作数据瓶颈。对正在构建通用操作模型的团队而言,这项工作指明了一条具体路径:先大规模合成,再在少量真实机器人数据上微调,而非全部依赖硬件采集。真实机器人上的收益验证,进一步增强了”先合成、后微调”策略在商用机器人学习栈中的说服力。