GORDON:基于图的物体中心奖励,实现长时程操作任务的自动分解
GORDON 从无动作的视频示教中学习稠密奖励:将每个视觉场景表示为检测物体及其空间关系构成的图,并用自监督图神经网络把这些图嵌入到与任务对齐的隐空间。该奖励的时间曲线在长时程任务中会显露出阶段式的物体状态迁移,从而支持自动子任务发现与顺序组合策略。在 MAGICAL 与 ManiSkill3 的七个操作任务上,长时程任务平均成功率达 74.4%,较最佳学习基线提升约 35 个百分点、较 oracle 提升约 25 个百分点。
原文 · arXiv:2608.03753背景
用强化学习解决长时程操作技能问题一直很困难,原因有三重叠加:奖励设计复杂、稀疏奖励提供的引导有限、人工标注子任务成本高昂。视觉示教可以为奖励学习提供监督信号,但从原始像素学到的奖励往往很脆弱——对视觉变化、背景外观和机器人运动都很敏感。业界真正需要的是一种跟踪真实任务进展的奖励信号,而不是像素统计量。
核心创新
GORDON 从无动作的视频示教中学习稠密奖励,其基础是物体中心的场景表示。每个视觉场景被编码为一张由检测物体及其空间关系构成的图,图神经网络以自监督方式学习将这些图嵌入到与任务对齐的隐空间。一种”活动感知加权池化”机制会强调与任务相关的物体,同时屏蔽机器人主导的运动,使表示与语义任务进展对齐。稠密奖励即为当前状态与示教目标构型在隐空间中的距离。在长时程任务中,该奖励的时间曲线会揭示出阶段式的物体状态迁移,从而无需人工分段即可自动发现子任务;发现的片段再用于训练子任务专属奖励与专用策略,并按顺序组合执行。
实验结果
在 MAGICAL 与 ManiSkill3 基准的七个操作任务上,GORDON 在短时程设置下改进了强化学习效果,并通过自动分解在复杂长时程任务上实现了成功的策略学习。长时程任务的平均成功率达到 74.4%——较最佳学习基线提升约 35 个百分点,较 oracle 提升约 25 个百分点,其中自动分解是收益的核心来源。
局限性
该框架依赖可靠的物体检测与空间关系提取,感知失败会传导到学到的奖励中。评测均在仿真基准中完成,真实世界的杂乱场景、遮挡与外观变化尚未覆盖。活动感知加权依赖”把任务相关物体与机器人运动区分开”这一前提,在机器人自身肢体深度参与场景的任务中可能更难成立。
行业影响
长时程操作仍是当前”跟随示教”策略走向工厂与仓储自动化之间的主要障碍之一。GORDON 直击标注瓶颈:奖励与子任务结构完全从视频数据中涌现,无需人工奖励工程或分段标注,这直接降低了将强化学习应用于装配、拣配、箱间转运等多阶段任务的成本。对于那些正在比较强化学习与模仿学习的团队而言,能够稳定跟踪任务进展的物体中心奖励信号,使强化学习在示教数据稀薄的阶段成为一个更可行的选择。