AeroAct:以动作为中心的世界动作模型用于语言条件四旋翼飞行
AeroAct是首个在实际四旋翼无人机上验证的世界动作模型(WAM),通过适配预训练的视频扩散Transformer,从第一视角视觉、本体感知和自然语言中预测轨迹-动作片段,实现闭环空中导航。
原文 · arXiv:2607.14997语言条件的四旋翼飞行需要在快速变化的第一视角下理解语义目标、预判自身运动的视觉后果,并输出平滑且动力可行的控制信号。现有方法要么采用离散动作空间、高层路径点,要么输出瞬时速度指令——这些都无法提供关于飞行动作如何改变未来观察的丰富监督信号。AeroAct引入了一种”世界动作模型”(WAM)范式,联合预测动作及其视觉后果,是首个在物理无人机平台上验证的WAM。
核心创新
AeroAct适配了一个预训练的视频扩散Transformer,从第一视角视觉历史、本体感知状态和语言指令中预测局部轨迹-动作片段。训练过程中,未来的第一视角画面作为密集的后果监督——模型不仅学习”该做什么”,还学习”做完后世界会变成什么样”。推理时直接解码动作,无需生成中间视频帧,保证了推理的轻量高效。
为生成对齐的训练数据(包含第一视角图像、状态估计、语言指令和动力可行轨迹),作者构建了包含以下组件的综合流水线:
- DiffAero:轨迹生成
- Isaac Lab:物理验证仿真
- 3D高斯泼溅渲染器:高质量新视角合成
此外,一款低成本手持采集设备将商用相机与运动估计相结合,模拟飞行中的第一视角轨迹,用于实际数据采集。自引导流程则提高了滚动预测中重叠轨迹片段间的时间一致性。
实验结果
闭环仿真和实际飞行实验表明:
- 引入时间视觉上下文的条件下,目标跟踪性能得到提升
- 物体搜索性能优于无视觉历史的基线方法
- 基于WAM的策略可在实际四旋翼平台上成功执行
- 端到端语言条件导航,输出平滑且动力可行的轨迹
局限性
摘要中未报告定量成功率和消融实验统计数据,需查阅完整论文。低成本手持采集设备可能导致与实际飞行数据之间存在分布偏移。训练数据生成对精心设计的流水线(DiffAero + Isaac Lab + 高斯泼溅)的依赖是一项显著的工程投入,可能限制结果的可复现性。
行业影响
这项工作为语言引导的自主四旋翼飞行器打开了大门——使其能够理解自身动作与视觉结果之间的因果关系。潜在应用包括搜救(用自然语言为无人机编队下达任务)、基础设施巡检(“绕飞塔台北侧”)以及航拍影视制作。WAM范式在飞行器上的首次成功验证具有广泛的可迁移性,可能从根本上改变自主无人机的编程方式——从路径点脚本到自然语言交互。