LightNav-0:激发VLM空间智能的通用具身导航模型
LightNav-0是一个紧凑的通用导航模型,它激发预训练VLM的空间智能并将其与导航对齐,无需任何任务专用预测头。统一token接口通过双通道指向表达与任务、场景、形态无关的空间意图,残差向量量化动作分词器再把意图映射为精确的、形态专属的轨迹。基于2000+场景、4000+小时具身导航数据的训练,LightNav-0在全部10个公开导航仿真设置上取得最先进的单目成功率,并在真实世界中展示了跨机器人形态、跨场景、面向静态与动态目标的零样本泛化能力。
原文 · arXiv:2608.30935具身导航要求智能体把异构目标——一句口头指令、一个开放词汇的物体名、一个需要跟随的人——转化为动作,并且要跨任务、跨环境、跨机器人形态完成。现代视觉语言模型其实已经编码了用于视觉接地、空间推理与指向的空间先验,但这些能力很少被直接调动起来服务于机器人控制。现有导航系统反而堆砌任务或形态专属的组件,把感知、推理与动作割裂开来,泛化能力受限。
核心创新
LightNav-0是一个紧凑的通用模型,它提取预训练VLM的空间智能并与导航对齐——且不设任何任务专用预测头。核心设计是统一token接口:双通道指向表达与任务、场景、形态无关的空间意图(看向哪里、去向哪里),残差向量量化动作分词器再把该意图映射为精确的、形态专属的轨迹。
时间感知的视觉历史压缩让模型能够跨时间推理;ER中训练、监督微调与强化学习进一步打磨对齐效果。最终一个模型即可同时处理指令跟随、开放词汇物体导航与视觉追踪。
主要结果
- 训练规模: 导航语料覆盖2000+场景、4000+小时具身导航数据。
- 推理底座: 用于初始化LightNav-0的LightNav-ER检查点在8个具身推理基准上取得最高的完整集平均分。
- 仿真: LightNav-0在全部10个公开导航仿真设置上取得最先进的单目成功率。
- 真实世界: 跨机器人形态、跨多样化场景、面向静态与动态目标均实现零样本泛化。
局限性
论文以基准领先为主张,但未展开失败模式——例如超长时程、极端杂乱场景或陌生场景类型的表现没有单独拆解。作为紧凑模型,它在纯推理能力上的上限可能低于更大的VLM,尽管导航性能已是最先进水平。真实世界结果以定性描述为主,摘要中未给出量化的硬件实测数据。
产业意义
一个能跨形态、跨场景零样本迁移的导航模型,对AMR与服务机器人车队有直接价值:车队无需为每款平台重新训练,共享一个导航骨干即可,形态差异交给各机器人的动作分词器处理。统一token接口还降低了新增任务类型的成本——这是通往通用移动机器人的务实路径。对仓储、配送与巡检机器人企业而言,这意味着VLM导航正从”逐应用工程”走向”整合型技术”。