像世界模型一样思考,像 VLA 一样行动:把世界模型表征蒸馏进轻量机器人策略
视觉-语言-动作(VLA)模型把观测映射成动作,训练目标里没有任何一项去刻画「世界会如何回应」,于是它的鲁棒性本质上被数据覆盖范围所限定:分布内可以很好,稍出分布就完全没有对「后果」的概念。世界模型恰好带着这个缺失的目标——它是被训练来预测下一刻会发生什么的,因此也更有物理根据——但把未来推进一步要花上秒级的计算,根本进不了控制回路。这篇文章主张二者本可分离:世界模型对物理场景的认知存放在它的内部特征里,而「生成未来」只是产生这些特征时所用的训练目标。于是接地能力可以被继承,生成机器则可以丢开。做法是在普通 VLA 训练中增加一项特征对齐损失:冻结的世界模型先在训练帧上跑一遍并缓存,学生只需去对齐这份缓存。训练时不加载教师,投影器用完即弃,部署策略与未蒸馏的基线完全相同,在消费级 RTX 5090 上仅 32 ms、1.86 GB。0.8B 的学生模型在 LIBERO 上达到 97.9%,把 RoboCasa-GR1 人形操作从 48.2% 提到 50.5%,并迁移到真实的单臂与双臂平台。
原文 · arXiv:2609.24682视觉-语言-动作(VLA)模型被训练来做一件事:把观测映射成动作。这个目标里没有任何一项去刻画「世界会如何回应这些动作」,所以它的鲁棒性本质上就是数据覆盖范围的函数——分布内可以表现得很好,一旦稍微走出分布,它就完全没有对「后果」的概念。世界模型恰恰带着这个缺失的目标:它是被训练来预测下一刻发生什么的,因此也更有物理根据。但把未来推进一步要花上秒级的计算,这让它彻底无缘控制回路。
核心创新
这篇文章的核心论点是:这两种能力从来就不是必须绑在一起的。世界模型对物理场景的认知,存放在它的内部特征里;而「生成未来」只是产生这些特征时所用的训练目标。于是接地能力可以被继承,生成机器则可以直接丢开——只借用世界模型的思考,不借用它的推演。
- 在普通 VLA 训练上加一项对齐损失。 冻结的世界模型先在训练帧上跑一遍、把特征缓存下来;学生模型在照常训练的同时,只需去对齐这份缓存。
- 把归因做干净。 训练时根本不加载教师,投影器用完即弃,部署的策略与未蒸馏的基线完全一致。作者给出的部署指标是消费级 RTX 5090 上 32 ms、1.86 GB,因此所有收益都归因于表征本身,而不是额外容量或测试期算力。
实验结果
- 0.8B 的学生模型在 LIBERO 上达到 97.9%。
- RoboCasa-GR1 人形操作从 48.2% 提升到 50.5%。
- 同一目标函数迁移到真机,在单臂与双臂平台上都成立。
- 收益在学生规模、主干网络、对齐层、教师模型被替换后依然保持——这才是关键信号:它指向一个泛化的表征先验,而不是两个特定网络之间脆弱的对齐。
局限性
LIBERO 是一个已经高度饱和的基准,所以 97.9% 是摘要里信息量最小的数字;真正承重的是 RoboCasa-GR1 上那 2.3 个百分点的提升与真机迁移。绝对提升幅度有限,摘要也没有给出真机实验的成功率、没有对齐损失权重与对齐层位置的消融、也没有在「更换教师」之外与其他蒸馏目标的比较。方法的上限受制于所蒸馏的那个冻结世界模型,而且它需要对整个训练集跑一遍世界模型(这是实打实的缓存开销,摘要未量化);它改进的是表征而非动作头,因此对于瓶颈在动作专家上的任务不一定受益。长时序行为、多任务干扰、语言泛化都未做刻画,足式运动与全身控制方面也没有任何证据。
行业影响
这个方法的吸引力在于部署时几乎免费:不增加延迟、不增加内存、不改架构,机器人上也不跑教师模型。对于在边缘交付机械臂的团队——策略必须塞进很小的内存与延迟预算里——表征层面的改进远比换一个更大的模型有用,而且它能与已经在产线上的任意策略架构组合。需要如实说明的前提是:它依赖手头有一个合适的世界模型可供蒸馏,而实测增益虽然真实,却属于渐进式改进。它最合适的定位,是给现有 VLA 训练流程加一个廉价的正则项,而不是一种全新的策略范式。