PASSAGE:用 100 小时场景对齐人体动作,训练能在杂乱环境中穿行的人形机器人

· Editorial Team estimated
人形机器人 复杂地形穿越 运动学习 流匹配 机载感知 仿真到现实

PASSAGE 是一个感知条件化的规划器—跟踪器框架,用于人形机器人在杂乱场景中的穿越。作者用虚拟现实与惯性动捕采集了 1500 个杂乱场景中 100 小时场景对齐的人体动作;条件流匹配规划器依据运动历史、局部目标点与机器人中心多层高程图生成短时域参考,具备感知能力的全身跟踪器再以 50 Hz 带几何反馈执行。实时分块保证块间一致性,规划器在冻结的跟踪器之上做强化学习后训练以提升闭环性能。整套系统不需要技能标注,也不用为每种障碍单独训练策略:同一对规划器—跟踪器即可在下台阶、侧身挤过、低头钻过之间自主选择与组合。把采集数据从 6 小时扩到 100 小时,held-out 场景的平均无接触成功率由 48.1% 提升到 68.9%,加入经校验的场景增强后达到 70.3%;全机载版本集成第一视角三维激光雷达、在线占据栅格建图、6.25 Hz 规划与 50 Hz 控制,在 Jetson AGX Orin 上于 50 个未见真实布局中完成穿越。

原文 · arXiv:2609.18732

人形机器人已经能跨过、侧身挤过、低头钻过障碍,但要让它在机载感知下自己决定「此刻该用哪一种」,一直是难点。既有做法大多依赖任务特定的强化学习目标,或者人工整理好的动作库——每加一类障碍就要重写奖励、重训策略、重建动作片段,能力覆盖的成本随场景复杂度线性上升。

核心创新

PASSAGE 的思路是:不要为每种障碍写策略,而是让人体动作本身来定义可用的运动先验。

框架由两部分组成。规划器采用条件流匹配(conditional flow matching),输入是运动历史、一个局部目标点,以及一张以机器人自身为中心的多层高程图,输出短时域的参考动作。跟踪器则是一个具备感知能力的全身控制器,以 50 Hz 执行规划器给出的参考,并在执行中引入几何反馈。整套接口是感知条件化的:规划器看到的是真实机载建图得到的几何,而不是预先摆好的障碍参数。

两个工程细节值得注意。其一是实时分块(real-time chunking):规划以 6.25 Hz 滚动输出动作块,分块机制保证相邻块之间不会互相打架。其二是规划器侧强化学习后训练:跟踪器保持冻结,只在规划器上做 RL,让闭环表现继续改善,同时不破坏已经稳定的底层运动能力。

数据侧同样是核心贡献:作者用虚拟现实与惯性动捕采集了 1500 个杂乱场景中 100 小时场景对齐(scene-aligned)的人体动作——即动作与场景几何是对应记录的。无需人工技能标注,也无需为不同障碍准备专用策略。

实验结果

  • 数据规模的收益被明确量化:在三个独立训练种子的设置下,把采集数据从 6 小时扩展到 100 小时,held-out 场景上的平均无接触成功率从 48.1% 提升到 68.9%;在加入经过校验的场景增强后,最终模型达到 70.3%
  • 同一对规划器—跟踪器覆盖多种行为:无需技能标签或障碍专用策略,模型在未见过的几何上自主选择并组合穿越行为。
  • 全机载运行:系统集成第一视角三维激光雷达、在线占据栅格建图、6.25 Hz 规划与 50 Hz 控制,全部跑在 Jetson AGX Orin 上;在 50 个未见过的真实物理布局中完成穿越,不依赖预建地图,也不依赖机外算力
  • 仿真中做了组件消融,逐项量化各阶段(规划器、跟踪器、分块、RL 后训练)的贡献。

局限性

摘要只报告了自身消融与数据规模曲线,没有给出与外部基线的对比数字;真实世界一侧只有「在 50 个未见布局上完成穿越」的定性描述,缺少真实成功率。70.3% 的无接触成功率意味着大约每三次尝试仍有一次会碰到障碍,而摘要没有讨论安全兜底与跌倒恢复。数据采集依赖虚拟现实与动捕设备,扩展成本未被量化。规划器的 RL 后训练在冻结跟踪器上进行,两者能力边界如何随跟踪器升级而变化也没有展开。

行业影响

「能走过去」是人形机器人从演示走向仓库、工地、家庭这类真实设施的第一道门槛,而这道门槛过去是靠在仿真里为每种障碍调奖励、攒动作库来翻越的,成本高且难以泛化。PASSAGE 的价值在于把这条曲线换成了数据曲线:采集更多场景对齐的人体动作,能力就随之增长——这是一种更接近「数据飞轮」的扩展方式,而不是「工程枚举」的方式。同时,规划器与跟踪器的分工、以及在冻结跟踪器上做规划器 RL 后训练的做法,给出一条把稳定运动先验与任务级微调解耦的工程范式:底层能力可以沉淀下来复用,上层则可以持续迭代。对一个正在搭建人形整机软件栈的团队而言,这套「人体动作数据 + 感知条件规划 + 机载全栈」的组合,比单点算法更接近于可以直接对照的部署蓝图。