Riemann-1.0:面向物理AI的具身世界动作模型

· 编辑团队 estimated
世界动作模型 具身智能 机器人操作 基础模型 预训练

Riemann-1.0是一个完全因果的自回归世界动作模型(WAM),将多视角视觉观测、机器人状态与形态特定动作作为因果状态转移统一建模在单一序列中,同一模型既可在线执行机器人策略,又可充当多形态视觉世界模拟器。基于20万+小时人类与机器人交互数据的渐进式具身预训练,在RoboTwin2.0上达到94.3%、LIBERO上99.0%、长时程组合基准RoboCasa-365上62.6%(较此前最优提升8.4%);真实世界长时程操作任务成功率达85.0%、进度成功率达94.4%,较最强开源基线高出15个百分点。

原文 · arXiv:2608.27033

具身智能需要既能行动又能预测的模型。世界动作模型(WAM)试图融合这两种角色,但现有的WAM要么采用联合生成、视频优先或解耦建模的范式,要么鲜有证据表明异构的具身经验——人类视频、手持夹爪演示、机器人轨迹——能被规模化地转化为一个可执行的统一策略。Riemann-1.0把统一推进得更远:一个完全因果的模型,同时是机器人策略,也是多形态的视觉世界模拟器。

核心创新

Riemann-1.0的设计建立在两个想法之上:

  • 统一因果序列——多视角视觉观测、机器人状态与形态特定动作被联合建模在一条因果自回归序列中,把机器人动作与世界演化视为因果状态转移。这使同一个模型既能在线执行策略,又能在同一次前向计算中模拟动作条件化的未来。
  • 渐进式具身预训练——以共享的世界动作建模目标,统一学习第一人称人类视频、手持夹爪演示与异构机器人轨迹,在20万+小时交互数据上把大规模具身经验渐进迁移为可执行的机器人操作能力。

实验结果

  • RoboTwin2.0:成功率94.3%。
  • LIBERO:成功率99.0%。
  • RoboCasa-365:长时程组合基准上62.6%,较此前最优方法提升8.4%。
  • 真实世界:长时程操作任务成功率(SR)85.0%、进度成功率(PSR)94.4%,SR较最强开源基线高出15个百分点。
  • 在模拟基准与真实操作任务上均达到SOTA。

局限性

最亮眼的数字集中于桌面式操作基准(LIBERO、RoboTwin、RoboCasa);摘要虽声称多形态模拟能力,但未详述非操作形态或长时程移动任务上的表现。20万+小时的预训练规模意味着巨大的算力与数据需求,文中未作分解。失败模式、安全行为与sim-to-real差距刻画也均未涉及。

行业影响

一个同时充当策略与模拟器的模型,把机器人学习的飞轮两半合二为一:它可以生成合成轨迹来训练或验证策略,随后把同一套权重部署到真实硬件。对人形机器人与通用机器人公司而言,Riemann-1.0的结果证明,跨人类与机器人视频的统一预训练——而非按形态单独搭建流水线——是通往通用操作能力的可行路径。85%的真实世界长时程成功率,也标志着开源具身基础模型开始在某些结构化操作流程中具备接近产品的实用性。