SLIM-0.5B:面向机器人操作的行动锚定预测隐空间学习
SLIM 是一个仅 0.5B 参数的紧凑隐空间交互策略,通过自监督掩码轨迹预测学习行动锚定的预测隐变量——同时刻画行动条件下的未来状态转移与能解释观测变化的行动——结合动作重建与未来隐变量预测。紧凑的 Mixture-of-Transformers(MoT)骨干网络建模观测隐变量与动作 token 之间的交互,策略采用流匹配训练以生成语言条件下的动作。在仿真基准与真实世界评估中,SLIM 以更少的参数、无需额外的具身预训练、更低的推理延迟与显著更低的 GPU 内存占用,达到或超过代表性的大规模 VLA 与世界行动模型基线。
原文 · arXiv:2608.09771背景
视觉-语言-动作(VLA)策略通常依赖大型多模态骨干网络,在每个控制步骤同时完成感知、语言条件与动作生成。其中很大一部分容量服务于开放域语义,而连续的机器人操作主要需要关于观测、动作及其所引起转移的紧凑表示。像素级世界模型提供了另一条路径,但预测与控制无关的视觉细节成本过高。这导致一个普遍现象:能力强的策略往往体积大、速度慢、内存占用高,限制了其部署场景。
核心创新
SLIM 是一个 0.5B 参数的隐空间交互策略,学习行动锚定的预测隐变量:既能刻画行动条件下的未来状态转移,又能表示能够解释观测变化的行动。这些表示通过自监督掩码轨迹预测学习,结合动作重建与未来隐变量预测,因此无需额外的具身预训练或大规模示教数据整理。紧凑的 Mixture-of-Transformers(MoT)骨干网络建模观测隐变量与动作 token 之间的交互,策略采用流匹配训练以生成语言条件下的动作。该设计刻意将模型容量集中在与控制相关的结构上,而非开放域的视觉细节。
结果
在仿真基准与真实世界评估中,SLIM 以更少的参数达到或超过代表性的大规模 VLA 与世界行动模型基线,且无需额外的具身预训练,推理延迟更低、GPU 内存占用显著更少。这些结果的组合表明,效率提升并未以任务性能为代价——紧凑架构在全面对比中具有竞争力,而不仅仅是一个轻量化的折中方案。
局限
摘要仅报告了与代表性基线相比的总体结果,未给出分任务明细,性能持平的具体幅度以及仍存在差距的任务尚未公开。跨多种具身形态、长时程任务以及易失败的真实世界条件下的评估覆盖仍需更多细节。MoT 设计引入了路由复杂度,有待独立复现与压力测试验证。
产业启示
部署成本——GPU 内存、延迟与预训练数据需求——是商用操作系统的首要约束。一个能与大型 VLA 与世界行动模型基线匹敌的 0.5B 策略,为边缘与机载推理、更经济的机器人集群以及更快的控制环路打开了大门,同时保留了 VLA 策略吸引人的语言条件泛化能力。对于评估具身基础模型的集成商而言,SLIM 提供了一个具体的数据点:模型规模与具身预训练未必是获得强大操作性能的前提条件。