WCM:面向视觉-语言-动作模型强化学习的 World Critic 模型

· Editorial Team estimated
视觉-语言-动作模型 强化学习 世界模型 机械臂操作 后训练

WCM 用基于轻量级 LeJEPA 架构的 World Critic 取代 VLA 强化学习后训练中的标量回报评论家,在估计价值的同时联合预测未来潜在状态,为评论家赋予显式的时间结构。在四个基准的 149 个任务与 7 个真实操作任务上,WCM 在 Pi0、Pi0.5 与 OpenVLA-OFT 上均取得分布内与分布外的最优性能。

原文 · arXiv:2607.29613

背景

对视觉-语言-动作(VLA)模型进行强化学习(RL)后训练已被证明是提升机器人操作能力的有效路径,其中基于评论家(critic)的方法最为流行。然而,这类方法中的价值估计器大多基于单帧观测或单帧 VLM 骨干网络特征——这与机器人控制固有的部分可观测性存在根本性错配。朴素地把观测历史拼进评论家,会在高维视觉空间中带来指数级复杂度,而且仍然会失败,因为纯标量回报回归无法为学习跨时间动态提供足够的监督信号。

核心创新

本文把失败根因定位为状态近似问题:缺乏显式世界建模目标时,评论家的表征无法捕捉准确价值估计所需的时间结构。为此,WCM(World Critic Model)基于轻量级 LeJEPA 架构,在估计价值的同时联合预测未来潜在状态,使评论家的表征被显式训练为捕捉时间动态,而不仅仅是回归标量回报。WCM 可无缝接入 on-policy 与 off-policy 两种训练流程,并兼容 Pi0、Pi0.5、OpenVLA-OFT 等主流 VLA 骨干网络。

实验结果

在四个基准的 149 个任务上的大量实验表明,WCM 在分布内与分布外场景中均稳定取得最优性能,泛化增益尤为突出。该方法还通过 OpenVLA-OFT 与 Pi0.5 的 off-policy RL 在 7 个真实操作任务上得到验证,确认了跨多样化场景的稳定部署能力。

局限性

性能增益仅在特定 VLA 骨干家族(Pi0、Pi0.5、OpenVLA-OFT)上得到验证,对其他架构的泛化性尚未证实。LeJEPA 评论家为流程增加了一个轻量但额外的训练组件;真实世界验证虽有意义,但覆盖 7 个任务。世界建模目标与架构选择各自的贡献尚未被完全剥离分析。

行业影响

RL 后训练正迅速成为操作类产品 VLA 开发流程的标准环节,而评论家失效正是 RL 微调在实际中表现不佳的常见原因。WCM 从根源上解决了这一问题,为交付 VLA 操作方案的团队——从人形机器人初创公司到工业机械臂集成商——带来样本效率与最终性能的双重提升。对主流骨干网络的即插即用兼容性,也显著降低了其在现有训练栈中的落地门槛。