DEED:面向零售人形机器人的数据高效后训练与经验驱动学习VLA框架
DEED是一个弥合人形机器人VLA系统从实验室到商店部署鸿沟的系统级框架,在超市货架补货任务中基于Unitree G1-Edu和GR00T N1.6进行了验证。它表明,通过精心设计数据和使用单GPU进行定向后训练,可以将朴素微调下失败的策略转化为可在真实世界中运行的系统,证明实验室到商店的鸿沟主要是一个系统集成挑战。
原文 · arXiv:2607.20345背景
弥补基准测试表现与可靠真实世界运行之间的差距仍然是视觉-语言-动作(VLA)人形机器人面临的核心挑战。这些系统必须处理执行错误、分布偏移和环境变化等训练仿真中不存在的因素。先前的方法主要关注架构创新,而非真实世界部署的实际挑战。
核心创新
DEED包含三个关键组件:(1)数据高效的后训练流水线,包括控制频率对齐、数据筛选、任务相关视觉高亮和降低VLA依赖度;(2)基于RECAP改编的真实世界经验驱动精化研究,采用基于文本的优势前缀和视觉语言值函数;(3)用于分析分布内和分布外行为的潜在空间分析工具。核心论点——并由实证结果支持——是实验室到商店的鸿沟主要是系统集成挑战而非架构问题。
具体结果
在基于Unitree G1-Edu人形机器人和GR00T N1.6基础模型的超市薯片补货任务中,DEED证明,通过精心设计数据和使用单GPU进行定向后训练,可以将朴素微调下失败的策略转化为可在真实世界中运行的系统。潜在空间分析工具提供了分布偏移的可解释诊断,使定向改进成为可能。
局限性
评估仅限于单一零售任务(薯片补货)和特定机器人平台(Unitree G1-Edu)。DEED流水线是否能泛化到其他零售任务、不同人形机器人平台或非零售环境尚未验证。该方法依赖于GR00T N1.6基础模型,该模型可能并非在所有部署场景中可用或最优。
行业影响
DEED直接解决了人形机器人部署中的关键瓶颈:从仿真或实验室训练策略过渡到鲁棒的真实世界运行所需的成本和复杂性。单GPU和精心数据管理就足以弥合这一鸿沟的发现对成本敏感的部署场景极具鼓舞意义。零售业——尤其是超市补货和货架管理——是人形机器人的巨大潜在市场,DEED为实现运营可行性提供了实用路径。