DexTacWAM:把接触动力学写进世界模型的视触觉灵巧操作框架
灵巧操作的成败由接触决定,而接触恰恰是相机看不全的部分:指尖压力、起滑瞬间、手指间的载荷转移,视觉几乎无法直接观测。当前的世界动作模型(World-Action Model)把预测式视频生成与动作生成耦合在一起,思路本来对路,但整体仍是「视觉中心」的,于是「预测出来的未来」里根本没有决定任务成败的接触动力学。DexTacWAM 让每个指尖独立编码,再用一个感知手指身份与手部姿态的触觉压缩器做聚合,最后把触觉 latent 注入视频扩散世界模型,使接触演化本身成为被预测的世界状态。在一个 22 自由度的双臂平台上,它在六个强接触任务上每一项都取得最高分,平均 70.6,对最强基线为 38.0;一个消融实验把「触觉世界建模」去掉而保留同样的触觉特征与动作专家,四项任务均值从 74.7 掉到 26.6,说明收益来自「预测接触」而非「用触觉做条件」。适配触觉只需约四小时、每任务约 100 条演示。
原文 · arXiv:2609.24976灵巧操作的成败由接触决定,而接触恰恰是相机看不全的部分。指尖压力、起滑的瞬间、载荷在手指之间的转移,这些量在视觉里几乎不可见,只靠图像训练的策略学到的其实只是任务「看得见的那一半」。世界动作模型(World-Action Model,WAM)看起来是自然的答案:把预测式视频世界建模与动作生成耦合起来,让视频预训练的先验迁移到控制中。但目前这一代 WAM 仍是「视觉中心」的——也就是说,那一大堆预测所指向的未来状态里,始终没有决定任务成败的接触动力学。
核心创新
DexTacWAM 保留了世界-动作的基本结构,但把触觉放进「被预测的状态」里,而不是放在动作条件旁边。
- 逐指尖独立编码。 每个指尖单独编码,而不是把触觉压成一个向量,模型因此保留了「哪根手指接触了什么」这一空间身份,接触的空间结构不会在编码器里被抹平。
- 感知手指与姿态的触觉压缩器。 各手指特征由一个以手指身份和手部姿态为条件的压缩器聚合,在降维的同时保住接触结构。该压缩器保留了融合前 89.4% 的接触召回,同时把训练提速 2.26 倍、推理提速 1.29 倍。
- 触觉 latent 注入视频扩散世界模型。 压缩后的触觉表示进入世界模型本体,于是视触觉联合世界建模把「接触如何演化」作为未来状态的一部分进行预测。
- 能把机制分离出来的消融。 在保留同样的触觉特征与动作专家的前提下,去掉触觉世界建模会让四项任务均值从 74.7 掉到 26.6。收益因此来自把接触演化建模为世界状态,而不是来自让动作专家以触觉为条件。
实验结果
- 22 自由度双臂平台上的六个强接触灵巧操作任务:DexTacWAM 在每一项上都是最高分,平均 70.6,最强基线为 38.0。
- 视觉到触觉的持续学习:在冻结预训练视觉 VAE 的前提下,约 四小时 的触觉编码器适配,就能用每任务约 100 条演示把预训练视频模型扩展到触觉,且不需要触觉中训练;视觉预测质量相比纯视觉版本仅损失 0.5 dB。
- 效率:触觉压缩器保留融合前 89.4% 的接触召回,训练快 2.26 倍、推理快 1.29 倍。
局限性
全部证据来自同一个 22 自由度双臂平台。摘要给出的是任务的汇总分数,没有逐任务拆解、没有失败类型分析,也没有不同触觉传感器类型或安装方式的横向比较。数据与算力方面的结论——每任务约 100 条演示、约四小时适配——只在一种设置下测得,它随任务多样性、物体种类、传感器硬件如何变化仍是未知。论文没有展示对未见物体或工具的泛化、没有长时序或多阶段任务、也没有平台之外的真实应用。此外它没有报告端到端的闭环控制频率:摘要中的加速数据属于压缩器,而扩散世界模型在每次决策时仍要付出生成代价,这个代价没有被量化。
行业影响
触觉可以说是最后一个尚未被大规模预训练机器人模型吸收的高价值感知模态,而常见的反对理由是「做触觉基础模型本身就是一个大项目」。这篇文章主张的是相反的路:复用已有的视频先验,用不多的数据和算力把它扩展到触觉,视觉主干保持冻结。对于灵巧手、双臂装配、以及任何手部遮挡视觉的任务,这都实质性地降低了做「接触感知策略」的门槛。真正剩下的问题很朴素却决定性——哪一种触觉传感器与安装方式能扛住量产磨损,以及当扩散式前向推演进入控制回路后,能否继续压在一个控制周期之内。