TurboVLA: 在RTX 4090上以32Hz、小于1GB显存运行的实时视觉-语言-动作模型
TurboVLA 将传统的 V→L→A 范式重构为直接的 V+L→A 映射,消除了大语言模型作为中心瓶颈。仅 0.2B 参数,在 LIBERO 上达到 97.7% 平均成功率,RTX 4090 上以 32Hz 推理,仅需 0.9GB 显存,匹配或超越远超其规模的 VLA 策略。
原文 · arXiv:2607.27205背景
视觉-语言-动作(VLA)模型已成为机器人操作领域的重要范式,但当前几乎所有架构都遵循以 LLM 为中心的设计:视觉观测被投影到大语言模型的表征空间后再解码为动作。这种 V→L→A 通路在每次策略调用时都需要大量计算和内存——通常需要数十亿参数、多块 GPU、以及难以在可及硬件上实现实时闭环控制的推理延迟。
核心创新
TurboVLA 通过用直接的 V+L→A 映射替代以 LLM 为中心的通路打破了这一模式。它不将大语言模型作为感知与动作之间的中心接口,而是独立编码视觉观测和语言指令。轻量级的双向视觉-语言交互模块直接在两种模态之间交换信息,然后一个紧凑的 Transformer 解码器从融合表征中预测连续动作块。
这一设计消除了将视觉特征通过大规模 LLM 投影的计算开销,同时仍能捕获任务条件化操作所需的跨模态交互。整个模型仅有 0.2B 参数——比基于 7B+ LLM 骨干网络的典型 VLA 策略小数个数量级。
实验结果
在 LIBERO 基准测试中,TurboVLA 在所有任务套件上达到了 97.7% 的平均成功率——匹配或超越远超其规模的 VLA 策略。关键的是,推理在单块消费级 RTX 4090 GPU 上以 32Hz(31.2ms 延迟)运行,仅使用 0.9GB 显存。与以 LLM 为中心的 VLA 模型相比,这代表了约 50 倍的参数缩减和相似的内存占用降低,同时保持了有竞争力甚至更优的任务性能。
局限性
评估在 LIBERO 仿真基准上进行,场景结构相对规整、光照一致。向具有显著域偏移、杂乱场景和传感器噪声的多样化真实环境泛化的能力仍有待验证。双向交互模块虽然高效,但在复杂多步骤任务规划中可能无法捕捉大型 LLM 骨干网络所能提供的深层推理能力。
行业影响
TurboVLA 对任何在物理机器人上部署 VLA 策略的团队都具有直接的实践意义。在 RTX 4090 上以 32Hz 运行、显存不到 1GB,意味着在成本低于 2000 美元、可置于桌面工作站的硬件上即可实现实时闭环控制。这极大地降低了基于 VLA 的操作任务的准入门槛,将其从大型实验室基础设施推向独立研究人员和小型公司。从以 LLM 为中心到直接视觉-语言-动作映射的范式转变也指向了更具可持续性和可扩展性的具身 AI 路径。