MiDAS:单条演示即可启动的通用机器人策略最小数据适应
· 编辑团队 estimated
机器人学习 离线到在线强化学习 少样本适应 VLA 双臂操作
MiDAS提出“最小数据适应”范式:预训练策略仅需一条演示,经行为克隆锚定后再通过残差策略上的基于价值的在线强化学习自主提升。在LIBERO与RoboCasa上仅凭单条演示即恢复强任务性能,并在双臂YAM平台上用约6小时在线交互将脆弱策略提升为鲁棒策略——据论文所述,这是首次实现可靠的单条演示策略适应。
原文 · arXiv:2608.11363机器人学习的核心目标之一,是摆脱“每个任务都要人工采集数据”的模式,让机器人通过自主交互持续改进。但完全自主的学习在当前策略下仍然困难:稀疏奖励与薄弱的零样本探索,使机器人几乎不可能从零发现成功行为。MiDAS聚焦于一个更现实、也更接近最终目标的中间地带——“最小数据适应”:一条预训练策略仅凭一条演示,加上后续的自主在线交互,就能学会一项新任务。
核心创新
MiDAS是一套简洁的离线到在线(offline-to-online)强化学习配方,分两步:
- 行为克隆锚定:用单条或少量演示将预训练VLA策略锚定到目标任务上,获得一个虽脆弱但可用的初始策略;
- 残差策略在线强化学习:在残差策略参数化上运行基于价值的在线RL,让机器人通过自主交互改进行为、超出演示所示的条件。
这一设定作为“完全自主改进”最接近的可解近似,使得研究者能够系统研究:最小的人类引导能否启动自主学习,以及哪些算法要素使其可行。
实验结果
- 在LIBERO与RoboCasa上,仅凭一条演示即恢复强任务性能,显著优于基线,并能泛化到演示之外的条件;
- 在双臂YAM平台上,从单条演示得到的低成功率脆弱策略出发,经过约6小时在线交互,策略鲁棒性提升并学会新的成功行为;
- 据论文所述,这是首次实现从单条任务演示出发的可靠机器人策略适应。
局限性
结果来自论文自报;真实平台验证集中于单一YAM平台,约6小时的在线交互时间与残差策略上的价值RL对超参数的敏感性都需要更多跨平台证据。最小数据范式仍需要至少一条演示以及安全的在线交互环境,尚不等于完全零数据的自主探索。
行业影响
MiDAS直接瞄准数据采集成本这一行业痛点:一条演示即可启动新任务学习,机器人部署后还能通过自主交互持续变强,这对仓储、家庭服务与人形机器人场景都极具吸引力。配方构建在现有VLA之上,无需改动模型架构即可采用,降低了企业的采纳门槛。若“演示启动+自主提升”的范式在更多平台上复现,将显著改变机器人技能的交付方式。