PredActor:可导向的机载人形机器人预测式动作扩散策略

· Editorial Team estimated
人形机器人 扩散策略 全身控制 机载推理 测试期导向 宇树 G1

扩散模型能生成灵活多样的动作,但要把这种灵活性变成能响应反馈的人形机器人控制器,中间隔着不少麻烦:分层方案通过动作参考来引导,而参考动作可能超出单独跟踪器的能力,于是恢复与物理执行都落到了跟踪器身上;只生成动作的扩散没有显式的未来状态轨迹可供测试期导向;联合状态-动作扩散虽然提供了这条轨迹,但代表性的控制器依赖特权式的全身状态估计,而行为选择与测试期导向又分散在不同环节里。PredActor 把这些能力收进一个直接用本体感知观测驱动的策略:以本体感知历史与可选任务上下文为条件,联合生成可执行动作和一条内部未来状态轨迹,用无分类器引导强化文本条件下的行为选择,用分类器引导把预测状态导向测试期目标;执行时只执行动作,既不需要单独的动作参考跟踪器,也不把外部估计的全身状态作为策略输入。仿真中它到达全部 15 个目标点,文本检索得分 0.580,而条件式动作扩散为 0.373;配合滚动去噪与保算力的运行时优化,完整回调在 Jetson Orin NX 上达到中位 16.790 ms、p95 19.383 ms,都落在 20 ms 控制周期之内。策略已部署在宇树 G1 上。

原文 · arXiv:2609.24840

扩散模型能生成多样、自然的动作,但要把这种灵活性变成能响应反馈的人形机器人控制器,中间并不是一小步。分层方案通过动作参考来引导,物理执行则交给单独的跟踪器:一旦参考动作超出跟踪器的能力范围,恢复就不再是策略的事。只生成动作的扩散去掉了参考,但它输出的动作没有显式的未来状态轨迹,测试期也就没有天然可导向的对象。联合状态-动作扩散提供了这条轨迹,可是代表性的控制器依赖特权式的全身状态估计——真机上并没有这样的输入——而行为选择与测试期导向于是被拆散到了不同机制里。

核心创新

PredActor 把这些碎片收进一个直接在机器人上执行的策略,且只以机器人自己感知得到的信息为条件。

  • 从本体感知联合生成动作与未来状态。 以本体感知历史加可选任务上下文为条件,策略同时生成可执行动作一条内部未来状态轨迹。执行时只执行动作
  • 两种引导各司其职。 无分类器引导强化文本条件下的行为选择,分类器引导把预测状态导向测试期目标。于是「选哪种行为」与「往哪个目标导向」都留在同一个策略里,而不是交给上面一层分层结构。
  • 不需要参考跟踪器,也不需要特权状态。 没有单独的参考跟踪器去继承误差,也不把外部估计的全身状态喂给策略。机载部署是设计出来的,而不是事后补的:滚动去噪加上保算力的运行时优化。

实验结果

  • 仿真:到达全部 15 个目标点,文本检索得分 0.580,条件式动作扩散为 0.373,而抗扰动存活能力与之相当。
  • 运行时:完整回调在 Jetson Orin NX 上为中位 16.790 ms、p95 19.383 ms,都低于 20 ms 的控制周期。
  • 真机:部署在宇树 G1 上,在仿真与真实硬件中展示了文本条件运动、扰动响应、手柄控制与语义插值。

局限性

摘要给出了目标点数量与文本检索得分,但没有运动跟踪误差、跌倒率或力矩饱和等指标,抗扰动能力也只以「相当」描述而未量化。证据覆盖单一平台(宇树 G1)与单一嵌入式计算模块,没有跨形态迁移,也没有长时间运行的可靠性数据。测试期导向是通过语义插值这类定性行为来展示的,没有对照可测量的目标函数;与分层基线的比较覆盖的是任务成功率与检索得分,而不是端到端延迟——而这恰恰是一个融合式策略本该占优的地方。16.79 ms 是一个完整回调的数字,但摘要没有说明闭环实际达到的控制频率,也没有交代去噪步数预算,因此向更高频率扩展的余量、以及热降频下的裕度,都不清楚。

行业影响

对人形机器人而言,扩散策略的硬约束从来不是动作质量,而是「策略能否在机器人自身有限的传感器上跑得足够快、从而闭合控制回路」。在 Orin 级硬件上把一个完整回调压进 20 ms 周期、且只依赖本体感知,意味着不再需要动捕系统或全身状态估计器——这两者在量产产品里既是成本项,也是失效点。把行为选择与测试期导向收进一个策略,也简化了软件栈:原本要在规划器、参考生成器与跟踪器之间拆分的逻辑,现在统一在策略内部。产品团队在下决心之前仍需要看到的是:量化的恢复表现、长时间运行下的可靠性,以及同一套建模在 G1 之外平台上的可用性——这些在摘要中都还没有。