ε4P:把不完美数据「升级再造」为高精度操作能力
高精度操作是视觉语言动作(VLA)策略最容易失手的地方,而它依赖的任务专用高质量数据通常来自遥操作,采集既慢又贵。ε4P 选择从数据侧而非模型侧解题:它把两类通常被直接丢弃的数据「升级再造」——目标任务上的低精度数据,以及任务不匹配的高精度数据——并且不是把它们均匀混进联合训练,而是控制每种数据在流匹配轨迹上的作用区间。低精度的目标任务数据用在高噪声段,保留任务层面的上下文;高精度但任务不匹配的数据用在低噪声段,迁移底层的动作精度。在真实机器人的亚毫米级高精度任务与粗粒度任务上,该方法把策略表现最多提升 31.7 个百分点,并且可以用不完美数据替换等量的任务专用高质量数据,平均仅损失 4.2 个百分点。
原文 · arXiv:2609.26672精度是通用机器人策略「不再通用」的那条线。VLA 模型能从大规模混合语料中学到宽泛的操作能力,但真正决定一个工业任务成败的环节——把连接器坐进插座、把线缆穿过孔位、合上亚毫米级的公差——几乎全部依赖任务专用的高质量演示,而这些演示来自遥操作。遥操作慢、需要熟练操作员、而且必须真的把任务跑一遍,于是「精度任务的数据恰恰最难采」成了一个结构性困境。常规答案是采更多。ε4P 的立场是:需要的东西里有相当一部分,已经存在于当前流程直接丢掉的数据里。
核心创新
论文识别出两类通常被排除在联合训练之外的不完美数据源,并说明它们携带的是互补信息。
- 目标任务的低精度数据。 任务本身是对的,但执行得不精确。它们编码了「这是什么任务、大致怎么推进」,但不包含干净的执行方式。
- 任务不匹配的高精度数据。 任务不对,但执行得很精确。它们编码了干净的底层动作结构,却不含目标任务的任何信息。
关键动作不是把两类数据均匀混合。流匹配策略的训练过程是一条从纯噪声到干净动作的噪声轨迹,而轨迹上不同噪声段承担的责任并不相同:高噪声段决定粗结构与任务级上下文,低噪声段决定细粒度动作细节。ε4P 据此把每种数据源送到它真正有信息量的区间——低精度的目标任务数据放高噪声段,高精度但任务不匹配的数据放低噪声段。两个不完美的来源因此变得互补而非冲突,而这一改动只是训练调度的决策,不改变策略结构。
实验结果
- 在涵盖 亚毫米级高精度任务 与 粗粒度任务 的真实机器人实验中,引入这两类不完美数据使策略表现最多提升 31.7 个百分点。
- 同一方法可以 用不完美数据替换等量的任务专用高质量数据,平均性能仅下降 4.2 个百分点。
局限性
摘要没有给出平台、任务数量、演示规模或基线清单,而 31.7 个百分点被表述为最好情况,因此跨任务的离散程度未知。方法仍然需要高精度数据源——它的「不完美」体现在任务不匹配,而不是执行质量差——所以如果一个团队手里完全没有精确演示,这一项带来的收益为零。此外,要承载任务上下文究竟需要多少低精度目标任务数据、新任务的区间边界该如何划定,都没有回答;在一种精度区间里有效的固定划分,未必迁移到另一种。论文没有展示对未见物体或工具的泛化、没有长时序多阶段装配,也没有说明该方法与强化学习精调如何配合。全部评估是真实机器人,但看起来局限于单一平台,同时没有报告推理或部署开销。
行业影响
精密自动化的经济性,本质上取决于「一个任务值多少小时的熟练遥操作」。如果这些不完美数据可以被系统性地重新利用,这个数字会在两处同时下降:目标任务的生疏或粗糙演示不再被浪费,而其它任务的精确演示也从「锁死在某个任务上」变成可复用的资产。用不完美数据替换后平均只掉 4.2 个百分点,在「采集匹配的高质量演示要花数周」的场景里是一笔值得做的交易。剩下的问题是很典型的生产问题:训练语料没有单一干净来源的策略该如何认证,以及这套调度方案有多少能在真实产线的波动下站得住。