Facet-0:面向接触丰富精密操作的机器人基础模型

· 编辑团队 estimated
接触丰富操作 机器人基础模型 精密装配 力控 强化学习

Facet-0 是一个会"预测并评估接触后果"的机器人基础模型:它把视觉-语言语义、运动学状态与因果腕力历史对齐,用流匹配同时生成动作块与预期诱发的腕部力/力矩曲线,并通过分布式的 Action-Wrench Critic 与接触选择性奖励把强化学习集中在决定性交互上。在 1,000 小时力同步语料 ManuFacet-1K 上训练后,该系统在五项亚毫米计算机装配任务上取得 82% 的平均成功率(最强基线仅 15%),放置精度 0.5 mm、指令延迟 50 ms。

原文 · arXiv:2609.01596

亚毫米级装配是工业机器人最难跨越的门槛之一:它同时要求空间精度、柔顺交互与对接触失败的鲁棒性。传统方案要么依赖高精度治具与示教编程,把接触当作需要规避的干扰,要么只能处理特定零件。Facet-0 的出发点很直接:一个真正有用的装配基础模型,必须学会预测并评估每一次动作的接触后果——不仅知道”手该往哪去”,还要知道”这一下会产生多大的力、会不会卡住、成不成功”。

核心创新

Facet-0 的核心是围绕”动作-腕力”联合提议(joint action-wrench proposal)组织整个模型:

  • 联合提议与流匹配生成——把因果的腕力历史与视觉-语言语义、运动学状态对齐,用流匹配(flow matching)同时生成动作块及其预期诱发的未来腕部力/力矩曲线,让模型天生带着”接触后果”做决策。
  • 分布式 Action-Wrench Critic——用部署滚动数据训练,能区分任务进展相似但接触结果截然不同的动作,为价值判断提供接触层面的分辨率。
  • 接触选择性信用分配——相位感知奖励与接触选择性信用把策略改进集中到真正决定成败的交互上,而不是稀释在平庸的移动阶段。
  • 轻量有界执行器适配——冻结表征之上复用一个小型有界 actor 完成单机快速适配;RL 仍然定义在可执行的笛卡尔动作上,辅助腕力头则保留”预测但不越权”的动作-接触耦合。

实验结果

  • 数据:ManuFacet-1K——1,000 小时力同步语料,覆盖三种机体与多个制造单元,是当前公开描述中规模最大的装配力交互数据集之一。
  • 成功率:在五项亚毫米计算机装配任务上平均成功率 82%,最强基线仅 15%,差距显著。
  • 精度与延迟:放置精度 0.5 mm,指令延迟 50 ms,具备实时闭环产线部署的条件。

局限性

任务集中在计算机装配域、规模为五项,跨域泛化能力尚未得到展示;每类零件仍需经过任务级适配(bounded actor),并非完全即插即用;分布式 Critic 依赖部署滚动数据,冷启动成本不低;论文摘要未披露失败模式的具体分布。

行业影响

消费电子与计算机装配是自动化价值密度最高的环节之一,连接器插拔、屏蔽罩与柔性排线等工序长期依赖人工或昂贵的高精度方案。82% 对 15% 意味着这类模型把亚毫米装配从”基本不可用”推到了”可上产线”的区间,而 50 ms 指令延迟与在线适配机制直接对准了换型频繁的制造单元。对装备厂商而言,“力同步语料 + 基础模型 + 轻量适配”的组合可能重新定义精密装配自动化的成本结构:从为每个零件定制治具与示教,转向以数据和模型为中心的快速部署。