RynnValue:用时间距离扩展机器人价值基础模型

· Editorial Team estimated
价值模型 奖励学习 机器人操作 基础模型 时间距离

RynnValue 是一个开源的机器人操作价值基础模型,用时间距离——从观测到语言指定目标的定向代价——替代偏好或进度标注作为监督信号。该方法无需偏好标注,在超过 7,000 小时、约 300 万条指令条件片段上训练,在 RBM-EVAL-OOD 上取得 0.675 的平均 Kendall tau_a,超过完全偏好监督的最先进方法(0.655),并比仅用进度的基线(0.292)提升一倍以上,且能零样本泛化到未见任务、具身与视角。通过基于势能的奖励整形转为稠密奖励后,真实世界策略成功率在线从 52.5% 提升到 72.5%,离线从 63.8% 提升到 82.5%。

原文 · arXiv:2608.09853

背景

通用奖励模型日益成为规模化机器人学习的瓶颈:策略的性能上限取决于引导它的奖励或价值信号。然而,目前大多数价值相关能力仍依赖与任务内部锚点绑定的监督,例如人类偏好或归一化进度。偏好标注成本高昂,且无法跨具身形态与数据源迁移,这阻碍了行业利用已经存在的大规模异构数据。业界缺少的是一种能自动大规模获取、同时仍能度量任务成功含义的监督信号。

核心创新

RynnValue 用时间距离取代偏好与进度锚点:即从观测到语言指定目标的定向代价(cost-to-go)。由于时间距离标签可以直接从时间戳推导,该方法无需任何偏好或进度标注即可扩展到超过 7,000 小时、约 300 万条指令条件片段。为使时间价值学习在大规模下保持可靠,作者结合了随机时间采样、时间顺序洗牌和“价值隔离注意力”机制来抑制捷径学习,使预测对失败与回退保持敏感,而不是坍缩到容易获取的统计线索上。最终得到一个通用价值模型,可通过基于势能的奖励整形转换为稠密奖励,为通用机器人策略提供实用的奖励接口。

结果

在无偏好标签训练的条件下,RynnValue 在 RBM-EVAL-OOD 基准上取得 0.675 的平均 Kendall tau_a,超过完全偏好监督的最先进方法(0.655),并比仅使用进度的对照(0.292)提升一倍以上,且能零样本泛化到未见任务、具身形态与视角。当输出通过基于势能的奖励整形转为稠密奖励后,真实世界策略成功率在线从 52.5% 提升至 72.5%,离线从 63.8% 提升至 82.5%,说明学到的价值信号能够转化为实际的操作性能。

局限

论文展示了强有力的基准与真实世界结果,但评估集中于操作任务与单一模型族,对其他机器人形态与长时程任务的泛化仍有待验证。时间距离目标预设了语言指定目标与有意义的进度概念存在,这对开放式或探索驱动型任务可能不太自然。作为开源发布,独立复现与对价值隔离注意力设计的压力测试,将决定该增益在作者数据分布之外是否稳健。

产业启示

奖励与价值模型正日益成为商用机器人学习流程中的实际瓶颈:偏好标注成本高,任务特定的奖励工程又难以规模化。一个基于时间戳监督训练的开源价值基础模型,能够以更低的标注成本提供稠密、可泛化的奖励信号,这对希望从示教数据采集转向自主策略改进的企业尤为重要。论文展示的跨任务、跨具身、跨视角的零样本迁移以及真实世界成功率提升,使 RynnValue 有潜力成为通用操作技术栈的基础组件,而非单一任务的奖励头。