TacPAC:面向接触丰富操作的世界动作模型触觉预测与实时动作校正

· 编辑团队 estimated
触觉感知 世界动作模型 机器人操作 接触丰富任务 动作校正

TacPAC把触觉预测转化为世界动作模型中的实时动作校正。纯视觉世界模型对未来的预测缺少决定接触丰富操作成败的局部接触线索,而朴素地把未来触觉观测当作额外视角预测,在实验中只能收回约三分之一的可实现增益——根源在于时间错配:预测先于执行,触觉反馈却在执行中才到达。TacPAC在基础模型规划出动作块后,缓存该规划所依据的预测接触及其表征,由触觉专家模型将每个新触觉图像与该缓存比对,仅校正尚未执行的动作,单次遍历缓存即完成校正,比重新生成动作块便宜20.7倍。在精密插入、易碎物操作、物体重定向与长时程操作五类真实机器人任务上全面领先,平均成功率由纯视觉基础模型的22%提升至64%,代码已开源。

原文 · arXiv:2609.05266

接触丰富操作(拧螺丝、插接、捏取易碎件)中,成败往往由指尖的局部接触决定。世界动作模型用预测的未来观测引导动作生成,但视觉中心的预测捕捉不到这些局部接触线索;简单地把未来触觉观测也当作”另一种视角”去预测,却收效甚微——论文实验显示只能收回约三分之一的可实现增益。TacPAC指出根因是时间错配:预测发生在执行之前,而触觉反馈在执行之中才陆续到达,两者天然异步。

核心创新

TacPAC把触觉预测从”生成额外预测”重构为”执行期校正”。一旦基础模型规划出动作块,TacPAC便缓存该规划所依据的预测接触,连同规划自身的表征;随后一个触觉专家模型把每个新观测到的触觉图像与这份缓存比对,只校正尚未执行的动作。关键设计在于:反馈不是孤立解读,而是对照”规划当时预期会发生的接触”来理解,从而区分正常偏差与真实异常。单次遍历缓存即完成一次校正,计算成本比重新生成整个动作块低20.7倍,满足实时性要求。

实验结果

  • 在精密插入、易碎物处理、物体重定向与长时程操作等五类真实机器人任务上,TacPAC全部领先。
  • 平均成功率从纯视觉基础模型的22%提升到64%。
  • 对照实验显示,朴素地预测未来触觉观测只能收回约三分之一的可实现增益,佐证了时间错配的诊断。
  • 代码已开源(LogosRoboticsGroup/TacPAC)。

局限性

成功率提升以纯视觉基础模型为参照,触觉传感器硬件是必要前提;不同任务上的成功率明细、对传感器噪声与磨损的鲁棒性、以及缓存比对机制在更长时程任务上的表现,摘要未展开,需结合论文正文与开源代码核实。校正仅作用于”尚未执行”的动作,对已执行动作引入的偏差无法追溯修正。

行业影响

精密装配、电子元件插接、易碎品搬运等工业场景长期面临”视觉到位、手感不足”的瓶颈。TacPAC提供了一条务实的工程路径:不必让世界模型在推理期反复生成触觉预测,而是用轻量触觉专家在执行期做廉价校正——20.7倍的成本优势使其具备进入实时控制回路的可能。对部署通用操作策略的厂商而言,这类”预测+执行期反馈校正”的架构思路也适用于力觉、听觉等其他高频传感通道。