HiFi-UMI: 仅使用高保真UMI数据训练可部署的机器人操作策略
HiFi-UMI 通过头戴式立体惯性SLAM、原生相对位姿估计和超广角立体相机,将机器人无需遥操作干预的UMI数据采集精度提升至末端执行器3毫米。仅基于此数据微调的策略在三个骨干网络家族上与同场景遥操作基线性能持平,4000小时预训练语料将未见任务的动作误差降低41%。
原文 · arXiv:2607.25895背景
可部署的机器人操作策略受限于高质量训练数据的稀缺性。真实机器人遥操作精度高,但扩展成本高昂。通过 UMI(通用操作接口)进行无需机器人的数据采集扩展性强,但当前实践仅将其用作预训练材料,仍需少量真实机器人遥操作数据进行后训练。这留下了一个核心问题:仅靠无机器人数据能否训练出可直接部署的策略?
核心创新
HiFi-UMI 是一个便携式数据采集系统,针对轨迹精度、夹爪间相对位姿、同步性和视野范围进行了协同设计。关键技术选择包括:头戴式离线立体惯性SLAM实现精确的相机自身运动估计、原生而非重建的夹爪相对位姿估计、所有相机共享微秒级GPIO触发信号、以及每只手两个覆盖约200度的超广角相机。该系统在无需任何外部追踪基础设施的条件下达到3毫米工作空间局部末端执行器精度。
关键成果是”零机器人后训练”:仅基于 HiFi-UMI 演示数据微调的策略可直接部署于真实机器人,并在三个骨干网络家族(涵盖视觉-语言-动作模型 StarVLA-QwenPI、OpenPI-pi_0.5 和世界-动作模型 LingBot-VA)上匹配同场景遥操作性能。
实验结果
HiFi-UMI 训练与遥操作训练策略的成功率差异分别为 -2.5、+3.1 和 -0.6 个百分点。最强策略在精密插入任务上达到85%的成功率——尽管 HiFi-UMI 轨迹并非在评估场景中采集,而遥操作基线是在评估场景中采集的。同一语料库的4000小时预训练将十个未见任务的动作误差降低了41%,并在 StarVLA-QwenPI 上将真实机器人额外提高了18.1个百分点。作者开源了 HiFi-UMI-2K——2000小时的微秒同步超广角演示数据集。
局限性
该系统需要头戴式硬件设备(SLAM相机套件)和离线后处理进行轨迹重建,限制了实时流式应用。当前验证限于抓取放置和插入任务,对更 diverse 的操作场景(灵巧操作、接触丰富操作)的泛化能力仍有待验证。
行业影响
对机器人团队而言,HiFi-UMI 的”零机器人后训练”结果具有变革意义:它意味着大规模、高质量的无需机器人数据采集可以替代昂贵且耗时的真实机器人遥操作进行策略训练。开源发布的2000小时经过验证的演示数据集为社区提供了重要资源。预训练将未见任务动作误差降低41%的结果进一步表明,建立主要从无机器人数据训练的通用操作模型的路径是可行的。