TANGO:基于全身视觉-语言-动作模型的杂乱环境人形导航

· 编辑团队 estimated
人形机器人 视觉-语言-动作模型 导航 全身控制 仿真到现实

TANGO是首个面向杂乱室内环境下人形机器人的全身视觉-语言导航框架。与二维路径规划不同,它把穿行视为连续的、几何感知的全身问题:给定自然语言指令与第一视角RGB观测,TANGO直接预测29自由度关节空间动作。模型完全在仿真中训练,通过全局路径规划、运动学全身动作生成、障碍感知动作编辑与基于强化学习的跟踪,合成多样的无碰撞穿行行为。TANGO在仿真视觉-语言导航中取得当前最优性能,在需要障碍协商的挑战性场景中优于强模块化基线,并在未使用任何真实导航数据的情况下,零样本部署到Unitree G1人形机器人上,在杂乱真实场景中实现稳健的语言引导穿行。

原文 · arXiv:2609.09158

传统机器人导航把运动建模为二维路径规划,但人形机器人在杂乱空间中穿行要难得多:每一步都可能需要手臂摆放、躯干调整与步态调节的协同,才能让整个身体挤过复杂的三维几何。TANGO把导航重新定义为语言条件化的全身任务,并端到端地学习它。

核心创新

TANGO是一个全身视觉-语言导航框架:输入自然语言指令加第一视角RGB,直接输出可直接用于下游全身控制的29自由度关节空间动作。其关键训练思路是一条合成数据流水线——在仿真中通过全局路径规划、运动学全身动作生成、障碍感知动作编辑和基于强化学习的跟踪,合成多样化的无碰撞穿行行为,为学习语言条件化全身策略提供动力学可行的动作监督——全程不需要任何真实导航数据。

实验结果

  • 在仿真视觉-语言导航中达到当前最优性能,在需要障碍协商的挑战性场景中优于强模块化基线。
  • 覆盖多种杂乱室内场景的大规模仿真实验。
  • 宇树Unitree G1人形机器人上零样本部署:未使用任何真实导航数据训练,即在杂乱真实场景中实现稳健的语言引导穿行。

局限性

摘要报告了仿真规模的对比与真机部署,但未给出量化的真实世界成功率指标(如跨场景的任务完成率或失败次数)。29自由度动作输出面向全身控制设计,但在G1之外的平台上跟踪鲁棒性如何尚不清楚;真实评估的场景数量、物体种类与指令多样性也未见详细说明。

行业影响

「听懂语言指令、在杂乱空间中穿行」正是人形机器人走出演示实验室的必修课:在货架通道、库房和家庭环境中执行自然语言指令。纯仿真训练即可获得、并能零样本迁移到宇树G1这类量产硬件的全身导航策略,意味着可以绕开昂贵的真实数据采集实现规模化训练——这对物流、服务与家庭机器人的人形落地是实质性的一步。