CLIFT:通过非侵入式闭环迭代微调,将 Gemini Robotics On-Device 打造成人形机器人专家

· Editorial Team estimated
人形机器人 视觉-语言-动作模型 微调 闭环学习 基础模型

CLIFT 展示了如何通过受管监督微调(SFT)API,将闭源权重的人形机器人基础模型定制为敏捷、接触密集任务的专家。通过把部署期的奖励反馈转化为 API 兼容的监督数据,CLIFT 在两个飞轮周期内将 Gemini Robotics On-Device 推向近乎完美的成功率——全程无需接触权重、梯度或损失。

原文 · arXiv:2607.29172

背景

最强的一批机器人基础模型通常使用专有数据训练并保持闭源,这限制了下游用户将其适配到新任务、新本体和新部署场景的能力。沿袭 LLM 社区的做法,闭源权重机器人基础模型的一种新兴访问范式是受管监督微调(SFT)API:用户提交训练数据,即可获得微调后的策略——但无法访问模型权重、梯度或训练内部机制。这类 API 让下游用户得以利用强大的专有模型,但也把策略改进限制在纯模仿学习范围内,排除了依赖内部训练信号的强化学习等闭环方法。这一限制在敏捷、接触密集的人形机器人操作任务中尤为突出,因为策略输出与真实部署行为之间的差距很大,源于新状态、动作跟踪动力学、延迟以及控制器特有的失败模式。

核心创新

CLIFT(Closed-Loop Iterative Fine-Tuning,闭环迭代微调)是一种在受管 API 框架内实现闭环改进的方法。它不试图”打开模型黑箱”,而是把部署期的奖励反馈转化为 API 兼容的监督数据:每个部署周期都会产生纠错性示范,通过 SFT API 再次提交,使策略在不接触权重、梯度、似然或损失的前提下持续迭代改进。本文还贡献了首个在真实人形机器人上对受管 API 适配进行实证研究的成果,以 Gemini Robotics On-Device(GROD)为载体,并与使用相同示范训练的主流开源权重 VLA 进行了直接对比。

实验结果

通过受管 API 的直接 SFT 明显优于使用相同示范训练的主流开源权重 VLA,但在敏捷、接触密集任务上仍未达到部署级熟练度。CLIFT 的飞轮机制弥合了这一差距:经过两轮”部署期反馈→API 兼容训练数据”的迭代,GROD 达到近乎完美的成功率——全程没有打开模型黑箱。

局限性

研究仅在单一受管 API(GROD)和特定人形机器人平台上验证,跨 API、跨本体、跨任务族的泛化性仍有待证明。飞轮机制依赖在部署阶段获得可靠的奖励信号,而实际中这类信号可能成本高昂或噪声较大。闭环数据转换的具体做法也依赖 API 对迭代式重复提交的容忍度,不同供应商的接口策略可能不同。

行业影响

对于大量基于闭源基础模型开发产品的机器人团队而言,CLIFT 提供了一条无需权重访问即可实现专业化的务实路径——对人形机器人整机厂商、机器人软件供应商以及在接触密集场景部署基础模型策略的企业都有直接参考价值。它把闭环调优重新定义为一种服务:受管 API 加部署期反馈即可实现纯模仿学习无法达到的任务熟练度。这也预示着一种新的商业模式——基础模型供应商与集成商共享优化闭环,同时倒逼开源权重方案在敏捷人形操作赛道上拿出更有竞争力的表现。