AtlasVLA:面向视觉-语言-动作模型的持久世界-自我状态建模
AtlasVLA 针对视觉-语言-动作(VLA)模型在部分可观测、长时程任务中的反应式局限,提出双记忆架构:4D 持久世界状态记忆将瞬态 2D 观测提升为全局更新的体素哈希空间状态,自我工作状态记忆则追踪历史自我状态与任务进度;扩散 Transformer(DiT)以该联合世界-自我状态为条件进行主动推理。仅使用单个腕部相机,AtlasVLA 即在 LIBERO、RLBench 与真实世界基准上取得 SOTA 成绩,在 LIBERO-Long 上超出多视角基线 9.4%,在真实长时程任务上超出 17.5%。
原文 · arXiv:2608.06729背景
视觉-语言-动作(VLA)模型极大推动了具身智能的发展,但其本质上反应式的范式——把当前观测直接映射为动作——在部分可观测与长时程任务中成为瓶颈。当机器人只依赖单个腕部相机时,物体一旦离开视野便被遗忘;在多步执行中,模型也会丢失任务进度。由此产生的”感知遗忘”与”任务进度遗忘”严重损害长时程操作的表现。
核心创新
AtlasVLA 用”持久世界-自我状态”上的主动推理取代反应式感知,其核心是双记忆架构。4D 持久世界状态记忆把瞬态 2D 观测提升为全局更新的体素哈希空间状态,在物体离开相机视野时仍能弥补视觉盲区;自我工作状态记忆则跨步骤追踪历史自我状态与任务进度。扩散 Transformer(DiT)以这一联合世界-自我状态为条件,实现跨时间的稳健空间推理。值得强调的是,整个系统只使用单个腕部相机——无需多视角支架或外部跟踪。
实验结果
AtlasVLA 在 LIBERO、RLBench 与真实世界基准上评测,仅凭腕部相机即取得 SOTA 表现,并显著优于多视角基线:在 LIBERO-Long 上绝对成功率提升 9.4%,在真实长时程任务上提升 17.5%。结果表明,在长时程场景中,持久记忆能够弥补并超越额外相机带来的信息优势。
局限性
评测虽覆盖面较广,但仍以结构化的操作基准为主,开放式或超长(数分钟级)任务尚未涉及。体素哈希世界记忆带来额外的计算与内存开销,在嵌入式平台上需要谨慎管理。性能提升是相对强 VLA 基线而言,严重遮挡或快速相机运动下的表现也未单独分析。
行业影响
从部署角度看,仅需单个腕部相机是显著的成本与简洁性优势:许多机械臂出厂即配备腕部相机,因此 AtlasVLA 式的持久状态可在不增加传感器的情况下升级现有硬件。长时程可靠性——记住看到过什么、做到哪一步——正是实验室演示与仓库、厨房、家庭中有用助手之间的分水岭。真实长时程任务上相对多视角系统 17.5% 的提升说明:记忆架构而非相机数量,可能是实用 VLA 策略的下一片前沿。