Surgical WAM:面向数据高效手术机器人学习的世界-动作模型
Surgical WAM先在无动作标注的内镜视频上预训练生成式世界-动作模型,再在固定预算的动作标注演示上微调,在四个模拟手术操作任务上将平均成功率从63.5%提升至77.8%。
原文 · arXiv:2608.11204学习可靠的手术操作策略长期受制于动作标注演示的稀缺。来自达芬奇研究套件(dVRK)等平台的遥操作轨迹成本高昂,而手术任务又对精确接触处理、长时程推理和双臂协同提出了严苛要求。相比之下,内镜视频便宜且丰富——是学习手术场景世界模型的天然资源。然而,此前的术式世界模型主要将视频用于仿真或策略评估,极少把学到的动力学转化为闭环控制。
核心创新
Surgical WAM(世界-动作模型)是一个基于Cosmos Policy构建的统一生成模型,联合预测未来的内镜观测与可执行的手术机器人动作块。它首先在无动作标注的视频上学习手术视觉动力学,然后在固定预算的动作标注数据上微调。部署时,模型作为闭环的滚动时域控制器运行:执行每个预测动作块的前缀,并根据新观测重新规划。
论文的核心问题是:在动作标注预算固定的前提下,无动作视频预训练能否改善闭环手术操作——整个设计正是为回答这一问题而构建。
实验结果
- 在四个模拟手术操作任务上,视频预训练将平均成功率从63.5%提升至77.8%
- 在PegTransfer上取得20个百分点的绝对提升,接触密集与双臂任务获益最大
- 证明无动作视频可为有限动作监督下的手术控制学习提供可迁移的视觉动力学先验
局限性
评估仅限于四个模拟任务,未报告实体dVRK或体内实验,接触密集型手术技能的仿真到现实迁移仍是开放问题。模型建立在Cosmos Policy基座之上,结果可能继承其归纳偏置。四个任务的覆盖面相对真实手术流程的广度仍然有限。
行业影响
手术机器人企业面临的成本结构正是本文所针对的:带运动学标注的遥操作数据是昂贵的瓶颈,而内镜视频大量可得。Surgical WAM勾勒出一条数据高效的手术机器人学习扩展路径,有望减轻dVRK等平台自主功能开发中的示教采集负担。若视频预训练能够迁移到真实器械,将加速缝合、组织处理等接触密集型子任务的半自主辅助——这对手术机器人行业是极具价值的进展方向。