TacWAM:基于锚点引导与力学感知触觉预测的世界动作模型

· Editorial Team estimated
世界模型 触觉感知 操作 视觉-语言-动作模型 接触丰富任务

TacWAM 是一个预测未来触觉状态(外观、密集力场与形变流)来监督接触丰富操作学习的世界动作模型,在四个真实世界任务上平均成功率达 75.0%,比最强基线高出 37.5 个百分点。

原文 · arXiv:2607.28391

背景

世界动作模型(WAM)在单一模型中同时学习预测未来状态并生成机器人动作,但现有方法主要依赖视觉未来。视觉预测能捕捉场景结构与物体运动,却难以对接触丰富操作中最关键的物理量——力、形变、剪切与滑动——提供充分监督。如何设计既携带有效物理信息、又不会成为动作分支可作弊的特权线索的触觉未来,是一个开放挑战。

核心创新

TacWAM 通过三项协同设计应对这一挑战。空间对齐融合(SAF)触觉编码器将触觉外观、密集力场与形变流映射到共享的潜在预测空间,并通过双边力与力矩重建保留全局接触信息。触觉历史编码器提供时间上下文,使未来触觉预测能反映力与形变随时间的演化。最后,锚点引导三模态(AGT)注意力将当前视觉与触觉锚点、未来预测 token 和动作 token 分离——使未来触觉状态能够监督训练,而动作分支无法直接读取。

实验结果

TacWAM 在四个真实世界接触丰富操作任务上进行了评估,覆盖易碎物体抓取、持续表面接触与动态手中操作。系统平均成功率达 75.0%,比最强基线高出 37.5 个百分点。逐步消融实验显示,移除触觉历史或放宽对未来预测目标的访问都会导致一致的性能下降,证实了未来触觉监督在配合信息丰富的触觉表示与部署一致的约束时,能够改善接触感知的动作学习。

局限性

评估覆盖了真实硬件上的四个任务,但范围(易碎抓取、表面接触、手中操作)只是接触丰富操作的抽样而非全面基准。该方法要求触觉传感器同时提供外观、力与形变信号,限制了其在缺乏此类传感的平台上的适用性。此外,未来触觉监督强度与动作分支信息泄漏之间的平衡较为微妙,可能需要针对不同任务族重新调参。

行业影响

插入、擦拭、手中重定向、易碎物处理等接触丰富任务,正是当前机器人系统在生产环境中失败率最高的场景。TacWAM 表明,触觉世界模型可以将易于采集的未来触觉信号转化为显著更优的策略,且不会在部署时泄漏特权信息。对于在非结构化环境中部署操作机器人的企业,这提供了一条务实的路径:更丰富的触觉感知加上世界模型式训练监督,在标准 WAM 与纯动作策略之上都能获得一致的性能提升。