DyPES-VLA:面向跨本体操控的共享动力学先验与本体特定控制学习
DyPES-VLA 是一种跨本体视觉-语言-行动(VLA)框架,将共享的动力学先验与本体特定的控制解耦。未来预测目标使视觉-语言骨干在异构数据上捕获物体运动、接触与交互引起的场景变化;本体特定的混合专家(MoE)动作头则直接在每种机器人的原生动作空间中把这些先验转化为可执行动作,免去手动动作对齐。作为单一通用策略,它在 LIBERO 上达到 98.0% 成功率,在 RoboCasa-GR1 上为 59.25%,在 RoboTwin 2.0 上为 89.02%。
原文 · arXiv:2608.06374背景
视觉-语言-行动(VLA)模型已成为机器人操作的主流范式,但几乎所有模型都只为单一机器人训练。能跨异构本体(不同机械臂、夹爪、相机安装方式与运动学结构)工作的通用策略,可让整个机器人车队共享一个模型并摊薄数据采集成本。当前有两大障碍:其一,现有方法未能充分利用跨视觉与交互数据共享的动力学先验,限制了跨本体迁移;其二,将本体特定的动作转换为统一格式需要大量人工预处理,随着新机器人不断加入,这种方法难以规模化。
核心创新
DyPES-VLA 将问题分解为共享先验与本体特定控制两部分。在先验侧,视觉-语言模型在跨本体数据上以未来预测为目标进行训练,驱动共享查询表示捕获物体运动、接触与交互引起的场景变化——这些物理动力学可跨机器人泛化。在控制侧,本体特定的混合专家(MoE)动作头直接在每种本体的原生动作空间中将共享先验转化为可执行控制,异构动作无需人工预对齐为统一格式。该动作头共享注意力层以捕获共有的时序动作结构,同时由本体特定的前馈专家处理各机器人的运动学约束与控制语义。
结果
作为单一通用策略,DyPES-VLA 在仿真与真实世界评估中均达到当前最优:LIBERO 成功率 98.0%,RoboCasa-GR1 为 59.25%,RoboTwin 2.0 为 89.02%。跨本体评估表明,共享动力学先验无需逐本体动作对齐即可跨机器人迁移,且 MoE 头可在不从头重训共享骨干的情况下扩展至新本体。
局限
主要指标来自仿真基准;摘要提及真实世界评估,但未给出同等详细的数据。MoE 动作头带来参数与路由开销,可能增加资源受限机器人上的推理成本;方法仍需要每种本体的专家数据来训练相应专家。论文也未说明当某本体的数据相对共享骨干较匮乏时,性能会如何退化。
产业启示
跨本体通用策略是机器人“基础模型”的经济核心:一个训练好的模型,服务多种机器人硬件。通过免除手动动作格式对齐、跨数据源共享动力学先验,DyPES-VLA 降低了车队中新增机器人的成本,并改善从数据丰富本体向数据匮乏本体的迁移。对运营异构机器人车队的制造商与仓储物流企业而言,这条路线指向一条务实路径:单一 VLA 骨干配合轻量本体适配器,即可服务多个硬件平台。