LIMBO:把安全证书学进策略本身,让 29 自由度人形机器人贴着可恢复边界运动

· Editorial Team estimated
人形机器人 全身控制 安全控制 控制屏障函数 强化学习 可恢复边界

安全全身控制要在高维非线性动力学下同时管住碰撞与平衡,而安全证书(控制屏障函数)通常是为某一类行为手工设计的,换任务就得重新设计、重新验证。LIMBO 把证书的合成从「设计」改成「学习」:在一个冻结的底层控制器周围学习状态-动作控制屏障函数,把安全判据写成基于状态的失败规范,从而在完整的残余动作维度上完成合成;合成阶段学到的安全价值函数还会引导风险采样,主动把样本撒向估计的可恢复边界附近。随后它充当教师,在任务学习阶段给出动作级的安全反馈,安全结构因此被内化进任务策略,部署时不再需要在线安全滤波器。作者在 29 自由度人形机器人上演示了躲闪球与低障碍下穿行两个任务,两者都迁移到真机且不带在线滤波;一个额外的发现是,在同一个安全规范下仅改变采样集中度,就能得到从下蹲到一种新的后仰钻越动作的策略谱。

原文 · arXiv:2609.22075

让高维、非线性的人形机器人在运动的同时保持安全,难点从来不在「知道要安全」,而在安全这件事怎么被写下来、又被谁执行。控制屏障函数(CBF)是控制理论给出的标准答案,但它通常针对某一类行为手工设计:换一个任务、换一种形态,就得重新设计、重新论证。人形平台把这个问题放大——动力学维度太高,在完整的控制维度上解 CBF 代价高昂;而那些真正决定成败的敏捷动作,恰恰发生在「快要失控但还救得回来」的边缘地带,这一带在仿真里极难被自然采样到。

核心创新

LIMBO 的做法是把安全证书的合成从「设计」变成「学习」,并让学到的证书最终进入策略本身,而不是停在部署时的监督回路里。

  • 在残余动作上学证书。 安全模型建立在一个冻结的底层控制器周围:状态-动作控制屏障函数(Q-CBF)描述的是「在这个状态、加上这个残余动作,会不会滑向失败」。失败规范由状态给出,而转移数据可以是黑盒的——不需要可微动力学,这在真机场景里非常关键。
  • 证书放在策略的控制空间里。 这是让高维全身控制变得可行的技术支点:证书不再面对原始关节空间,而是面对任务策略实际动作的那一层,于是「在完整控制维度上合成安全证书」从不现实变成可做。
  • 风险引导采样。 合成阶段,学到的安全价值函数反过来引导数据采集,把样本集中投向估计的可恢复边界附近,而不是均匀铺开。
  • 当老师,而不是当看门人。 任务学习阶段,这个安全价值函数提供动作级的安全反馈,把安全性蒸馏进任务策略。结果是部署时不再需要在线安全滤波器

一个耐人寻味的副产物:在同一个安全规范下,只要改变采样的集中程度,得到的策略就从「下蹲」一路变到一种新的「后仰钻越」(limbo)动作。作者把它解释为一种有理论依据的探索机制——风险引导的边界采样,决定了策略最终选择哪一种化险方式。

实验结果

  • 平台为 29 自由度人形机器人,两个任务:躲闪球低障碍下穿行
  • 两个任务都迁移到真机,且都不依赖在线安全滤波器。
  • 在相同安全规范下,改变采样集中度可复现从下蹲到后仰钻越的策略谱,说明控制变量确实是采样而非任务定义。

局限性

摘要没有给出跌倒率、碰撞率这类安全性的绝对数字,也没有列出对照——例如带在线安全滤波器的同类策略、或传统的 CBF-QP 方案——在同一任务上的表现。因此「免去在线滤波」这个主张目前缺少代价对等的比较数据。安全证书的学习依赖一个基于状态的失败规范,也就是必须先定义「什么算失败」;这个规范是否完备、遗漏的失败模式会带来什么后果,摘要未作讨论,而安全边界恰恰由它定义。风险引导采样需要在估计的可恢复边界附近采数据,这类数据在真实硬件上本身就难以安全获取,论文对仿真与真机之间的数据来源交代不足。此外,验证只覆盖两个任务、一个平台,跨形态(四足、双臂、其他机器人)与跨任务的可复用性尚未得到证明。

行业影响

安全证书的复用一直是机器人从实验室走向现场的主要摩擦点:每换一个行为就要重做一轮安全论证,而在线安全滤波器又常常以牺牲动作幅度和速度为代价换取安全。LIMBO 演示的路径把安全组件的形态改了——从「运行时监督模块」变成「训练期教师 + 策略内化」。对于追求敏捷性的人形与动态足式平台,这意味着同样的安全规范有可能被不同行为共享,且部署时不必再挂一层会限制性能的滤波器。现实的门槛也很清楚:失败规范的完备性论证、以及真机上安全地采集边界附近数据的工作流程,才是这套方法能否进入工程实践的关键,而这两点恰恰是摘要之外的空白。