TurboVLA: 在RTX 4090上以32Hz、小于1GB显存运行的实时视觉-语言-动作模型
TurboVLA 将传统的 V→L→A 范式重构为直接的 V+L→A 映射,消除了大语言模型作为中心瓶颈。仅 0.2B 参数,在 LIBERO 上达到 97.7% 平均成功率,RTX 4090 上以 32Hz 推理,仅需 0.9GB 显存,匹配或超越远超其规模的 VLA 策略。
TurboVLA 从根本上重新定义了 VLA 范式,从以 LLM 为中心的 V→L→A 转向高效的直接 V+L→A。仅 0.2B 参数即达到 LIBERO 97.7% 成功率,RTX 4090 上 31.2ms 延迟、0.9GB 显存。卓越新颖性(28/30)、强实验证据(22/25)、极高行业部署价值(24/25)。