MINERVA:操作策略究竟可以做到多小还能解决 LIBERO?
· 编辑团队 estimated
VLA 模型效率 LIBERO 基准分析 机器人学习
MINERVA 用刻意压缩的视觉运动策略度量 LIBERO 基准的任务专属容量下限:仅 0.54M 参数的策略在四个标准 LIBERO 套件的 2000 次 rollout 中取得 95.1% 平均成功率——比论文报道的 LeRobot pi0.5 仅低 2.4 个百分点,参数量却少 7700 倍。性能在约 1M 参数处饱和,低于 0.25M 则崩溃。任务 ID 置换探针显示标准 LIBERO 指令条件化主要是在已记忆任务间做选择;该微型策略在笔记本电脑 CPU 上每控制步重规划仅需 5-9 毫秒,比 SmolVLA 快 113 倍、比 pi0.5 快 1400 倍。
原文 · arXiv:2609.03715数十亿参数已经成为视觉-语言-动作(VLA)模型的默认货币,大型 VLA 如今统治着 LIBERO 操作基准。但一个很少被问及的问题是:这个基准真正需要多少容量?MINERVA 逆转了常见的扩展叙事——不问策略要多大才能赢,而是问策略可以做到多小还能解决任务。
核心创新
- 容量下限测量——MINERVA 系列刻意压缩的视觉运动策略,量化了 LIBERO 实际所需的最小模型容量。
- 0.54M 参数达到 95.1%——在四个标准 LIBERO 套件的 2000 次 rollout 中,仅比报道的 LeRobot pi0.5 低 2.4 个百分点,参数量却少 7700 倍;性能在约 1M 参数处饱和,低于 0.25M 即崩溃。
- 对 LIBERO 测什么的诊断探针——任务 ID 置换探针显示,标准指令条件化主要是在已记忆任务之间做选择(仅重映射任务 ID 即把成功率打到接近随机);flow matching 相比直接 L1 回归无可检测优势,GPU 上反而慢最多 3.8 倍。
实验结果
- 四个标准 LIBERO 套件平均成功率 95.1%(0.54M 参数、2000 次 rollout),在 89 个 LIBERO-90 任务上达 94.6%。
- 无 GPU 条件下笔记本电脑 CPU 每控制步重规划仅 5-9 毫秒——比 SmolVLA 快 113 倍、比 pi0.5 快 1400 倍。
- 鲁棒性边界被量化:LIBERO-Plus 扰动使性能降至 46-56%,对光度扰动鲁棒性接近为零。
局限性
LIBERO 只是单一模拟基准家族,而论文自己的探针也表明其部分信号来自任务记忆而非可泛化的指令跟随——因此该容量下限是基准专属结论,不能外推为真实世界操作的论断。即使对紧凑策略而言,分布偏移下的鲁棒性依然堪忧;摘要层面未涉及真实机器人部署。
行业影响
对于在日益庞大的 VLA 骨干上重金投入的团队,MINERVA 是一剂清醒剂:如果一个基准用亚兆参数、能在笔记本上毫秒级重规划的策略即可解决,那么对许多部署场景而言,昂贵的 GPU 推理栈只是不必要的开销。该工作激励容量感知的架构搜索、以及把大 VLA 蒸馏成微型部署策略的路线;同时也在提醒基准卫生——LIBERO 式套件上的榜单增益,必须先排除记忆化因素,才能被当作通用能力的证据。