Agile-WAM:把触觉世界模型做「轻」——不必生成未来视频,也能预判接触
世界动作模型(World Action Model, WAM)通过同时预测未来的世界状态与机器人动作,让策略学到支撑控制所需的物理动力学,因而超越了传统的视觉运动策略。但近期的触觉 WAM 往往依赖大规模预训练的生成式主干来刻画接触丰富的物理动力学,代价是推理效率低、部署不灵活。本文提出 Agile-WAM,一个用于接触丰富操作的高效触觉世界动作模型:它把视觉与触觉观测编码进一个共享隐空间,并以该隐空间为起点做直接的「视觉-触觉到动作」流匹配,从而联合生成动作块的隐表示与未来的视觉、触觉隐表示。其关键观察是视觉与触觉信号的时间尺度本就不同——相邻视觉帧高度相似,而触觉信号在接触发生时会突变——因此提出多时域多模态预测:以更大的时间偏移监督视觉隐表示,同时只预测下一帧的触觉隐表示以捕捉精细接触动力学。在九个仿真与五个真实世界接触丰富操作任务上,Agile-WAM 在成功率上优于最强基线,同时保持低推理延迟;在五个真实实验中整体成功率相对提升 29.4%,推理延迟为 11.9 毫秒。
原文 · arXiv:2609.20761世界动作模型(WAM)的思路是:不只预测动作,还同时预测未来的世界状态。这样策略能学到支撑控制所需的物理动力学,而不必只从「看到什么就输出什么」里隐式地猜。对接触丰富的操作来说,这个方向尤其有吸引力——接触瞬间的动力学恰恰是纯视觉策略最容易失手的地方。
问题出在实现方式上。近期的触觉 WAM 大多直接把大规模预训练的生成式主干搬过来刻画接触动力学:能力是有的,代价是推理开销大、部署不灵活。而接触控制偏偏是那种「慢一点就不成立」的场景——机器人要在毫秒量级上对接触做出反应。
核心创新
Agile-WAM 的选择是不再生成未来的视频画面,但也不放弃对未来的显式建模。
它把视觉与触觉观测编码进一个共享隐空间,以该隐空间为起点做直接的**「视觉-触觉到动作」流匹配(flow matching)**,在一次过程中联合生成两类东西:
- 动作块的隐表示;
- 未来的视觉隐表示与触觉隐表示。
也就是说,未来仍然被显式地表示出来,只是表示在隐空间里,而不是重建为像素或图像帧。
真正让这个设计站得住的,是一个物理观察:视觉与触觉的时间尺度本就不同。相邻视觉帧往往高度相似,变化缓慢;而触觉信号会在接触发生的一瞬间突变。用同一个时间步长去监督两种模态,必然在一边浪费、在另一边欠拟合。
于是作者提出多时域多模态预测:
- 视觉隐表示在更大的时间偏移上被监督——因为视觉变化慢,看得远一些更有信息量;
- 触觉隐表示只预测下一帧——因为接触动力学是快变的,必须贴近当下。
这是一个把「传感器物理特性」直接写进训练目标的设计,而不是靠更大的模型去覆盖。
实验结果
- 覆盖九个仿真任务与五个真实世界接触丰富操作任务。
- 在成功率上优于最强基线,同时保持低推理延迟。
- 五个真实实验:整体成功率相对提升 29.4%,推理延迟 11.9 毫秒。
11.9 毫秒这个数字是这篇工作最有分量的部分之一。它把「世界模型」从一种离线分析工具,推向了可以嵌进高频控制回路的组件——对触觉反馈这类必须闭环的操作,延迟本身就是可行性的边界。
局限性
摘要只给出相对提升(29.4%),没有给出绝对成功率,读者无法判断基线水平与真实可用性;「最强基线」具体是谁、差距多大也未说明。触觉硬件与传感器的具体形态、标定方式、以及训练所需的触觉数据规模均未提及,而这恰恰决定这套方法能否迁移到别的机器人手上——换一套触觉传感器是否还需要重新采集数据,是落地时最现实的问题。11.9 毫秒的延迟没有交代测试平台(算力、是否含图像预处理)。九个仿真任务与五个真实任务覆盖的接触类型、物体软硬程度与失败模式也都没有细分说明。
行业影响
接触丰富操作是当前工业自动化最不愿碰、也最难绕开的一块:装配、插接、柔性件抓取、抛光,全靠接触那一刻的力与滑移信息。这类任务长期以来要么靠专用夹具和示教规避,要么靠高成本力控硬件兜底。Agile-WAM 传递出的工程信号是清晰的:触觉世界模型不必以生成式大模型为代价,把未来表示在隐空间、并按各模态真实的时间尺度分别监督,就能在毫秒级推理内使用。对于同时在传感器端(触觉阵列)与算法端投入的团队,这条路线降低了「模型能不能跑在机器人上」这一关的门槛;对类人形与灵巧手平台而言,11.9 毫秒量级的世界模型也让「快反应接触控制」从设想变成了可以排期的工程目标。