Dynin-Robotics:把动作、目标与动力学预测统一进一个全模态扩散 VLA
本文把视觉目标预测与动力学预测带进动作的生成与选择环节,方法是通过一个共享的轨迹模型来统一表达它们。模型构建在 Dynin-Omni 全模态掩码扩散骨干之上,将语言、视觉观测、目标与动作都表示为离散 token;只需改变条件区间与目标区间,同一个模型就能同时学会动作预测、动作条件下的下一观测预测、终末目标状态预测,以及轨迹到指令的重建。这些接口支持推理期扩展:通过目标预测、动作候选评估与动作-未来状态的联合细化来提升成功率。作者在约 133 万条、来自 48 个 Open X-Embodiment 数据集的轨迹上继续预训练,并在四个操作条件下于 Franka Research 3 机器人上取得 78.4% 的平均成功率。
原文 · arXiv:2609.13053视觉目标预测与动力学预测对机器人策略有互补价值:前者给出”要到达什么结果”,后者刻画”动作会如何改变场景”。以往它们通常被当作独立模块或辅助损失,与动作生成本身割裂。
核心创新
本文把这两类预测直接引入动作的生成与选择过程,做法是让它们共用同一个轨迹模型。具体实现建立在 Dynin-Omni 这一全模态掩码扩散骨干之上:语言、视觉观测、目标与动作全部被表示成离散 token。
关键设计在于只需改变条件区间与目标区间,同一个模型便能同时学会四类任务:动作预测、动作条件下的下一观测预测、终末目标状态预测,以及轨迹到指令的重建。这一统一性进一步支撑推理期扩展——通过目标预测、动作候选评估,以及动作与未来状态的联合精细化来提升最终表现。
实验结果
- 在约 133 万条轨迹、48 个 Open X-Embodiment 数据集上继续预训练,再分别适配下游领域。
- 在 VLABench 的两个任务上,机器人预训练能在固定的第二阶段步数预算内改善适配效果;完整的目标混合训练相比仅策略训练的基线,在指令偏移情形下成功率更高。
- 目标引导与动作-未来状态联合去噪的组合,相比仅解码动作进一步提升指令偏移成功率——但收益取决于预测的组合方式。
- 在 LIBERO 上表现有竞争力,零样本 LIBERO-Plus 亦如此;在 Franka Research 3 上四个操作条件的平均成功率为 78.4%。
- 经优化的块并行实现在所述评测配置下把模型侧动作解码加速最多 29.2 倍。
局限性
摘要未给出 LIBERO 与 LIBERO-Plus 的具体数值,“有竞争力”无法量化;也未报告不同任务间的失败模式与最差情形。收益对”预测如何组合”敏感,说明这套统一目标并非即插即用,需要针对任务调参。29.2 倍的加速比是在特定 profiling 设定下测得的,尚未证明能稳定折算为整体控制回路时延;此外摘要未说明模型规模、推理硬件,以及是否开源。
行业影响
把动作、未来观测与终末目标放进一个骨干、一套 token 词表,意味着过去需要多个专用模块(策略、评估器、目标生成器)才能完成的事,现在可以由一个模型承担,减少了模型管理与版本漂移的成本。更重要的是”目标预测 + 动作候选评估”这类推理期扩展,为用算力换可靠性提供了直接的旋钮:在安全敏感任务上多花推理预算、在常规任务上退回单次解码,是部署端非常实用的取舍方式;而 29 倍量级的解码加速则直接关系到能否满足实时控制频率。