VLA-ULAP:把云端 VLA 调用与端侧超轻量动作预测交替执行

· Editorial Team estimated
VLA 端侧推理 云边协同 动作分块 能效 Jetson

十亿参数级的视觉—语言—动作(VLA)策略既需要可观的机载功耗,又受制于远程推理的通信延迟。VLA-ULAP 提出把远程 VLA 调用与一个超轻量本地动作预测器(ULAP)交替执行:ULAP 连同冻结的视觉编码器共约 740 万参数,一次性融合当前视图、本体感知与已执行动作历史来预测动作块,可独立训练,不需要 VLA 的隐状态、在线校验或服务端往返。在 Jetson Orin Nano 上,ULAP 单次推理为 19.9 毫秒与 0.183 焦耳,而 GR00T 在 RTX A6000 上是 284.3 毫秒与 50.55 焦耳。在三组仿真「基座策略—基准」组合上,所选工作点可去掉 48.8% 至 76.7% 的 VLA 调用,同时保留基线成功率的 95.0% 至 97.5%。在 SO-101 真机上,系统在已见与留出摆放上保留基线成功率的 95.2% 至 100%,推理时间估算降低 47.9% 至 58.0%,推理设备能耗降低 52.1% 至 62.5%;在感知延迟的 LIBERO-Safety 仿真中,其动态任务成功率还比 π0.5 高出 11.0 与 15.5 个百分点。

原文 · arXiv:2609.18663

视觉—语言—动作(VLA)模型正在成为机器人操作的主流策略范式,但把它推到真机上会遇到一个非常现实的矛盾:十亿参数级的策略需要可观的机载算力与功耗,而把推理放到远端又要付出通信延迟的代价。更麻烦的是,这两条路都不是「优化一下就好」——功耗和延迟直接影响机器人的响应速度与动作平滑度,尤其是需要快速反应的动态任务。

核心创新

VLA-ULAP 的做法是让云端与端侧交替工作,而不是二选一。

核心是一个超轻量本地动作预测器(ULAP):连同冻结的视觉编码器在内约 740 万参数,一次性融合当前视图、本体感知与已执行的动作历史,直接预测动作块。它的几个性质决定了这套方案可落地:

  • 可独立训练:不依赖 VLA 的隐状态,不需要在线校验,也不需要服务端往返。这意味着一台新机器人不需要先拿到 VLA 的内部接口就能部署。
  • 系统级可调:VLA 调用与本地预测的比例是一个可调的工作点——延迟或能耗预算紧就多跑本地预测,任务难度高就多调云端。摘要给出的三组仿真组合正是用不同工作点覆盖了这一权衡区间。

本质上,这不是对 VLA 做压缩或蒸馏,而是在系统层面对「何时必须调用大模型」这个问题给出一个可配置的答案。

实验结果

作者给出了不同层级上的证据:

  • 端侧开销:在 Jetson Orin Nano 上,ULAP 单次推理耗时 19.9 毫秒、能耗 0.183 焦耳;作为对照,GR00T 在 RTX A6000 上为 284.3 毫秒、50.55 焦耳
  • 仿真成功率保持:在三组「基座策略—基准」组合中,所选工作点去掉了 48.8% 至 76.7% 的 VLA 调用,同时保留基线成功率的 95.0% 至 97.5%
  • 与本地加速方案对比:在 VLA-JEPA 上,与 ACT 相比,ULAP 在相近成功率下估计少用 49.2% 推理时间51.0% GPU 能耗/成功回合;与 SP-VLA 相比,同等成功率下少用 77.1% 时间79.9% 能耗
  • 真机验证:在 SO-101 上,已见与留出摆放都保留了基线成功率的 95.2% 至 100%,推理时间估算降低 47.9% 至 58.0%,推理设备能耗降低 52.1% 至 62.5%
  • 延迟敏感任务上反而更好:在 LIBERO-Safety 仿真中,VLA-ULAP 在两个任务上分别比 π0.5 高出 11.0 和 15.5 个百分点,同时 VLA 调用量约减半——作者把这一增益归因于更快的响应。

局限性

需要指出的是,真机与能耗的数字中有相当一部分是估算值(摘要明确写了 estimated,依据是成功回合的调用次数与实测设备成本),而不是全流程端到端实测。ULAP 是独立训练的,因此它对基座策略的适配性取决于训练时的动作分布,摘要没有讨论基座策略更换或任务分布漂移时会怎样。成功率保留区间(95.0% 至 97.5%)是相对基线的比例,绝对失败率仍会随基座策略本身的水平浮动。此外,摘要未说明 ULAP 的架构细节、训练数据规模与训练成本,也未提及是否开源。

行业影响

如果 VLA 要真正跑在机器人身上,功耗和延迟必须下降一个量级,而云边协同在这个过程中几乎是必然的形态——网络断掉时机器人不能停,靠近物体时又需要大模型的语义判断。这篇工作的价值在于它把这种协同做成了一个有明确旋钮的系统:调用比例可调、端侧预测器可独立训练、在真机上验证了成功率保留与能耗下降,并且在延迟敏感任务上给出了「响应更快,反而做得更好」的证据。对做机器人本体或具身智能平台的团队来说,这意味着一条不需要等待更强 VLA 或更小 VLA 的现成路径:把大模型当作偶尔咨询的专家,而不是每一步都必须等到的老师。