HOST:机器人从单段人类视频中秒级习得操控技能

· Editorial Team estimated
单样本学习 模仿学习 技能习得 人机技能迁移 机器人操控

HOST使机器人能够从单段人类视频中平均29秒习得新的操控技能,同时保留已掌握技能。它在各任务上达到62%的平均成功率——超过零样本基线45%,甚至超过每个任务用50段机器人演示微调的基线,且所需演示量少50倍,技能习得快507倍。

原文 · arXiv:2607.20033

背景

快速、轻松地获取新技能并同时保持已掌握技能的能力对于实用机器人至关重要。现有方法依赖耗时且昂贵的训练循环,不仅成本高昂,还会侵蚀已掌握的技能。这使得将机器人学习扩展到多样化任务变得不切实际——每个新技能都需要大量机器人专用演示数据和重新训练,限制了在动态环境中的部署。

核心创新

HOST(人机单样本技能习得)通过自基预测级联实现技能获取。它首先估计机器人在演示任务中的进度,然后将即将进行的步骤转化为机器人自身对未来观测的预测,最后从这些预测观测中推导出动作。该级联模型通过将机器人轨迹和视频演示映射到共享的任务进度流形上进行训练,重新定义每个目标以与视频的未来进度对齐。HOST使机器人能够主动遵循演示过程,并根据自身形态进行适配。

具体结果

HOST在推理阶段从单段人类视频中平均29秒习得新技能,平均成功率达到62%。它超过零样本基线45%,同时完全保留了已掌握的技能。HOST甚至超过每个任务使用50段机器人演示微调的基线,所需演示数据减少50倍,技能习得速度快507倍。这些结果证明了机器人技能获取在数据效率和速度方面的巨大进步。

局限性

62%的成功率虽然显著优于基线,但在鲁棒性方面仍有改进空间。性能可能取决于人类演示视频的质量和清晰度,而需要精确力控或密集接触交互的任务可能面临额外挑战。该方法在需要高灵巧性或长跨度多步骤任务上的可扩展性仍有待验证。

行业影响

HOST从单段人类视频中秒级习得技能并保留现有能力的特点,可能彻底改变工业机器人技能部署方式。操作员只需录制一次新任务的演示视频,机器人即可立即投入运行,无需数周的数据收集和模型重训练。这大大降低了在仓库、物流中心和家庭等频繁变化需求的动态环境中部署机器人的门槛。