Robostral Navigate:基于8B视觉语言模型的单目RGB纯视觉导航

· Editorial Team estimated
视觉导航 视觉语言模型 单目RGB 具身AI 零校准迁移 R2R-CE

Robostral Navigate是一个8B参数的视觉语言导航模型,仅需单目RGB图像——这是所有机器人平台上最普遍的传感器——即可通过在当前视野中指向下一个目标位置来预测路点。纯图像空间操作使其对相机内参和场景尺度变化具有自然鲁棒性,可在轮式、足式和空中机器人之间零校准部署。在R2R-CE上达到77.4%的成功率,在RxR-CE上达到75.1%,超越最佳单目方法10.5个百分点,甚至超过基于深度或多相机的系统5.3个百分点。

原文 · arXiv:2607.20785

背景

传统视觉导航依赖深度传感器、多相机系统或预构建地图来获得可靠结果。这些硬件假设限制了可运行学习型导航策略的平台范围,并增加了部署成本。单目RGB相机是几乎所有机器人平台都配备的传感器,但单目导航策略在历史上一直落后于配备深度传感器的方案。

核心创新

Robostral Navigate是一个8B参数的视觉语言模型,仅需处理单目RGB图像流,即可在当前视角中指向下一个目标位置来预测路点。在纯图像空间而非机器人专用坐标系中操作,使策略对相机内参和场景尺度变化具有天然鲁棒性,可在轮式、足式和空中机器人之间无需重新校准直接部署。训练流程在35万模拟场景中生成了240万条轨迹。创新的前缀缓存方法将完整回合打包到单个训练序列中,减少22倍训练令牌,将训练时间从数月缩短至数天。树状注意力掩码防止模型依赖之前的真实动作,鼓励基于视觉的动作预测,强化学习进一步提升了探索和恢复能力。

具体结果

在R2R-CE和RxR-CE基准测试中,Robostral Navigate取得了新的最先进成果。在R2R-CE上达到77.4%的成功率,超越最佳单目方法10.5个百分点,超过最强的深度或多相机系统5.3个百分点——尽管只使用了单个RGB相机。在RxR-CE上达到75.1%的成功率,超越所有单目基线。结果表明,精心设计的训练可以拉平甚至逆转单目与深度导航之间的性能差距。

局限性

该模型在模拟环境(Habitat)中训练和评估。在真实物理机器人上以纯RGB设置进行部署是验证仿真到现实迁移的必要下一步。8B参数规模虽然按现代LLM标准不算大,但对于资源受限的板载计算可能仍有挑战。前缀缓存方法虽然大幅降低了训练成本,但增加了架构复杂性。

行业影响

Robostral Navigate对可扩展机器人部署具有重要意义。通过消除对深度传感器、多相机系统或预构建地图的需求,它降低了硬件成本和标定工作量。在同一策略下无需修改即可在轮式、足式和空中机器人间部署的能力,对车队运营者和机器人即服务提供商具有变革性意义。22倍的训练令牌缩减也使得没有大量计算预算的团队能够采用该方法。这项工作推动了一个未来愿景:导航成为一种由无处不在的RGB相机支持的软件能力,而非传感器依赖的集成挑战。