Skytopia:用动作条件隐世界模型实现单目无人机导航
机器人导航中的世界模型通常被设计成「要被执行」的:部署时先产生预测,再在每一个控制步把预测反馈给动作生成。Skytopia 认为这个契约本身是错的——策略真正需要的不是预测结果,而是产生该预测所必需的表示;因为在飞行中,已执行的动作几乎解释了相邻观测之间的全部变化,预测退化为「在已知位移下重投影一个静态场景」。于是策略建立在一个动作条件的隐世界模型之上,并用专门搭建的三维高斯泼溅平台训练:前向目标从意图运动预测下一观测的表示,逆向目标则从预测出的状态转移中恢复该运动。由于预测从不进入动作生成,预测器在部署时被直接丢弃,一个策略同时覆盖点目标、图像目标与无目标导航,成功率分别为 57.8%、66.0% 与 49.0%,同时把推理开销降低 59.4%。同一策略无需微调即可在实体无人机上飞行,覆盖室内、开阔室外与林地环境。
原文 · arXiv:2609.26007单目无人机导航的难点很简单:一台前视相机的观测几乎不直接提供深度与尺度信息,策略只能从图像如何变化中推断世界的结构。世界模型是标准答案——学出「观测在动作下如何演化」,再把这套预测机制放进回路。但标准做法把系统绑死在「执行自己的预测」上:模型在部署时生成一个未来观测,并在每一个控制步把它反馈给动作生成。这很昂贵,而对无人机来说,昂贵就等于飞行时间变短。Skytopia 的主张是:预测不是产品,使预测得以成立的那份表示才是。
核心创新
- 已执行的动作解释了变化。 飞行中,相邻两次观测之间的差异绝大部分由机器人实际发出的运动解释,于是预测未来观测就退化成「在已知位移下重投影一个静态场景」。生成式预测器能在这个控制回路里补充的东西很少。
- 动作条件的隐世界模型。 策略训练在动作条件的隐世界模型之上,而不是重建出的像素上。前向目标从意图运动预测下一观测的表示。
- 让表示落地到动作的逆向目标。 第二个目标从预测出的状态转移中恢复运动,正是它把学到的隐表示与动作绑定,而不是让它停留在纯视觉编码。
- 部署时丢弃预测器。 因为预测从不进入动作生成,世界模型的预测头在推理阶段被去掉,保留下来的表示驱动同一个策略,覆盖点目标、图像目标与无目标导航。
- 用于训练的三维高斯泼溅平台。 一个专门的高斯泼溅训练环境提供视觉结构,使策略不必依赖世界模型去重建这些结构。
实验结果
- 成功率:在三种导航设定下 Skytopia 都优于所有基线,点目标 57.8%、图像目标 66.0%、无目标 49.0%。
- 效率:丢弃预测器可减少 59.4% 的推理开销,等于把世界模型彻底移出部署路径。
- 真机部署:同一策略 无需微调 即在实体无人机上飞行,能在 室内、开阔室外与林地 环境中抵达目标。
局限性
报告的成功率是仿真结果,摘要没有给出真机部署的对应量化数字——室内、室外与林地的飞行只被描述为「抵达目标」,没有成功率、试验次数或失败模式。文章的核心论点,「已执行的动作解释了观测间几乎全部变化」,是作为设计前提被提出的,而不是被测出来的;它在什么情况下失效(例如移动障碍物、风扰、显著光照变化)没有被刻画,而无目标这一设定本身也是三者中最弱的,只有 49.0%。三种导航设定共用同一个策略,但摘要没有说明它们是联合训练还是分别训练,也没有给出策略在无人机机载算力上每次决策的开销。此外论文没有在相同推理预算下与「执行式预测」的常规世界模型做对比。
行业影响
空中自主飞行有一个长期存在的成本结构:感知与预测栈越强,机载算力就越重,而载荷、功耗与续航都要为此付费。证明「世界模型可以为控制而训练,但其最昂贵的部分可以在部署时被移除」直接关系到任何必须在嵌入式硬件上运行平台——首当其冲是无人机,但也包括功耗预算紧张的足式与手持系统。一个策略同时覆盖点目标、图像目标与无目标三种设定,也指向「单一导航栈」而非一族任务专用模型。接下来业界会追问的是诚实的虚实迁移账:仿真成功率已经给出,真机结果是定性的,两者之间的差距才是决定这套方法能有多少进入实际飞行的关键数字。