PAC-MAN:面向全身安全的人形机器人躲避球感知感知 CBF-RL 框架

· Editorial Team estimated
人形机器人 控制屏障函数 强化学习 全身控制 安全

PAC-MAN 将控制屏障函数(CBF)安全机制与贴近部署的真实机载感知相结合,用于人形机器人全身闪避。仅凭头戴相机与训练期 CBF 引导训练的策略即可达到接近特权状态oracle的闪避表现,零样本部署到宇树 G1 后在真实世界投掷中成功率达 95%。

原文 · arXiv:2607.28623

背景

腿足机器人的安全保证通常依赖控制屏障函数(CBF),而这类方法往往假设可以获得准确的特权状态信息。但在实际部署中,人形机器人只能通过噪声较大的机载传感器感知环境——例如头部相机,而不是提供完美球体轨迹的 oracle。如何弥合形式化安全方法与真实感知之间的鸿沟,尤其是对于每个肢体都需要避免接触的全身任务,一直是一个悬而未决的问题。

核心创新

PAC-MAN(Perception-Aware CBF-RL,感知感知 CBF-强化学习)将基于屏障的安全机制与感知感知的强化学习相结合。部署策略仅通过头戴相机的分割掩膜深度观察世界,而在训练阶段,CBF 模块基于每个身体连杆的间隙提供引导。对抗性运动先验对产生的闪避反射进行正则化,防止策略收敛到不现实或不安全的运动模式。

一个关键发现是,可用的屏障结构与感知可观测性密切相关:关节级 CBF 在球状态准确时表现最佳,但在固定相机观测下仅作为训练引导时会退化,只有配备球跟踪云台或特权运行时滤波器才能恢复。这促使作者采用轻量级的连杆级 CBF 策略,使其能够容忍不完美的感知。

实验结果

在受控的任意连杆接触基准测试中,采用种子化投掷,感知受限策略的表现仅比特权状态 oracle 低几分,表明仅靠固定机载相机就足以完成闪避。在真实世界中,连杆级 CBF 策略零样本部署于宇树 G1 人形机器人,在 95% 的投掷中成功闪避,并利用语义分割躲避不同类型的球。

局限性

评估集中在单一的人形机器人平台和躲避球式闪避任务上。基准涵盖单次投掷和走回站位的部署循环,但未覆盖人形机器人在拥挤或非结构化环境中可能遇到的全部动态扰动。此外,依赖语义分割识别球体意味着目标物体必须在视觉上可区分。

行业影响

在贴近现实的感知条件下实现人形机器人安全,是仓储、工厂和公共场所商业部署的核心瓶颈。PAC-MAN 表明,可以在训练阶段嵌入形式化安全结构,同时保持部署端感知栈的简洁——这为希望在不过度增加传感器成本的情况下获得可认证安全裕度的制造商提供了一条务实路径。任意连杆接触基准以及轻量级策略可容忍不完美感知的结论,对正在开发双足与人形平台全身防碰撞能力的团队具有直接参考价值。