BridgeVLA++:具备数据高效、强泛化与记忆增强能力的 3D 操作视觉-语言-动作框架

· Editorial Team estimated
视觉-语言-动作模型 三维操作 时空记忆 数据效率 双臂操作

BridgeVLA++ 在数据高效的 BridgeVLA 三维操作框架之上引入统一的时空记忆架构,同时建模持久的空间上下文与时间交互历史,使策略能够基于观测历史进行推理,且不牺牲数据效率与泛化能力。该方法在两个依赖记忆的操作基准上达到当前最优,支持双臂操作场景,并在另一套真实机器人平台上完成验证。

原文 · arXiv:2608.05042

背景

基于预训练视觉-语言模型构建的视觉-语言-动作(VLA)模型是三维机器人操作的主流范式,但它在实际落地中面临三个短板:数据需求大、分布偏移下泛化有限、缺乏对历史观测的显式记忆。最后一点对真实部署尤为关键——搜索-抓取、存在遮挡的装配、或任何要求机器人记住”已经看过什么、做过什么”的任务,对只以当前帧为输入的策略而言几乎无从下手。作者此前的 BridgeVLA 通过保持预训练 VLM 的输入-输出对齐来解决数据效率问题:将原始点云投影为多视角图像,并在生成动作之前预测中间热图。BridgeVLA++ 正是其记忆增强的下一代。

核心创新

核心贡献是一套嫁接在 BridgeVLA 之上的统一时空记忆架构,包含两个组成部分:持久的空间上下文,记录物体的位置与场景结构;以及时间交互历史,追踪机器人已经执行的动作。与把记忆拼成扁平向量的做法不同,该框架显式建模这两个维度,并让策略在决策时对观测历史进行推理。关键在于,记忆模块是在 BridgeVLA 保持对齐的设计之上叠加的,因此原框架的数据效率与泛化特性被完整保留,而不是被牺牲掉。该架构还扩展到双臂操作——在这种场景下,两条机械臂状态的跨臂记忆尤其有价值。

实验结果

BridgeVLA++ 在两个具有挑战性的依赖记忆的操作基准上取得当前最优成绩——而这恰恰是此前没有显式记忆的 VLA 模型通常失败的场景。它在空间操作任务上保持强劲表现,并在分布偏移下展现出稳健的泛化。除基准之外,框架还在双臂设置与另一套真实机器人平台上得到验证,说明该方法可以跨任务、跨环境、跨硬件扩展,而非针对单一实验室场景调参。

局限性

摘要报告的是基准层面的结果与定性鲁棒性结论,未细分各记忆依赖场景的单独表现,也未量化记忆模块在训练数据、延迟或算力上的额外开销。真机验证被描述为可扩展性的展示,而非系统的多条件对照实验。与其他 VLA 结果一样,基准上的提升需要结合训练数据分布的具体情况来解读。

行业影响

记忆正是”只会跟随示教的机器人”与”能在杂乱、部分可观测、多步骤作业中工作的机器人”之间缺失的一环。一个在保持数据效率的同时加入持久场景与交互记忆的 VLA 框架,对存在遮挡的料箱抓取、需要跟踪零件状态的装配单元、以及要求双臂保持协同的工位都有直接价值。在第二套真实平台与双臂场景上的迁移验证,也增强了”这是通用能力而非基准特例”的说服力——这对在量产操作系统中挑选 VLA 主干的集成商而言至关重要。