SUN:面向语言接地控制—学习—实机策略的持久化程序

· 编辑团队 estimated
模型预测控制 语言条件操作 强化学习 仿真到现实 机器人学习

Kuafu提出语义统一(SUN)程序——一种类型化可执行程序,几何与接触关系只需定义一次,即可编译为对齐的MPC代价、满足谓词、RL奖励、转移守卫与诊断信号。大型视觉语言系统从语言与场景语义自动合成SUN程序,MPC先进行可行性筛查,保留的语义再用于训练分阶段策略。在九个任务上Kuafu取得82.03%的宏观成功率(稀疏奖励基线35.67%、Stage-BC基线24.75%),8192路并行规模下每小时遥操作产生的成功轨迹时间是传统方式的10.57倍;每个任务500条轨迹训练出的DP3策略在仿真中达到46.0%、在真实Franka与Kinova机械臂上达到34.7%的成功率——全程无需示范数据或人工稠密奖励。

原文 · arXiv:2608.31167

长时程操作长期处于两种传统之间的未解张力中:基于模型的控制精确执行既定目标,学习方法则把这种行为摊销成反应式策略。然而现有的桥接方案几乎都会丢弃任务语义——奖励被迫手工设计,学习到的行为逐渐偏离控制器真正验证过的行为。其结果是”任务意味着什么”与”策略优化什么”之间只存在松散的联系。

核心创新

Kuafu给出的答案是语义统一(SUN)程序——一种类型化可执行程序,几何与接触关系只定义一次,即可编译为一族相互对齐的产物:模型预测控制(MPC)代价、满足谓词、RL奖励、转移守卫与诊断信号。由于所有产物都源自同一份源码,控制器、学习器与验证器优化的是同一套成功标准。

大型视觉语言系统从语言与场景语义自动合成SUN程序;训练前先由MPC进行可行性筛查,因此策略只会学习控制已经认证过的行为;保留的语义随后用于训练分阶段策略,把符号规划与数据驱动执行统一起来。

主要结果

  • 九个任务、显著优势: 宏观成功率82.03%,稀疏奖励基线为35.67%、Stage-BC基线为24.75%。
  • 数据效率: 在8192路并行规模下,Kuafu每小时人工遥操作产生的成功轨迹时间是传统方式的10.57倍。
  • 下游策略: 每个任务仅用500条轨迹,Kuafu数据训练的DP3策略在仿真中达到46.0%的成功率(替代方案仅22.4%),在真实Franka与Kinova机械臂上达到34.7%。
  • 无需示范、无需稠密奖励: 整条流水线仅凭语言与场景语义即可运行,这是论文中最具实际价值的主张。

局限性

评估覆盖九个任务、特定的一类操作技能;该方法向高形变物体、动态接触或更长时间跨度任务的扩展能力尚未验证。合成环节依赖大型视觉语言系统,因此上限受制于VLM的场景理解水平。真实机器人成功率(34.7%)仍低于仿真(46.0%),仿真到现实的差距只是收窄而非消除。

产业意义

对操作机器人企业而言,最直接的价值是数据经济学上的跃迁:用语言描述的任务语义被直接编译为训练信号,免除了示范数据采集与专家奖励工程。MPC可行性筛查同时为昂贵的训练与部署提供了安全过滤器。若该方法能推广到更多任务族,则预示着这样一种工作流——车队运营方用自然语言描述任务,拿到的是经过验证、可直接部署的策略——这是工业与服务操作走向实用自主性的重要一步。