ω-0:面向人形机器人同步移动-操控的隐空间预测世界行动模型

· Editorial Team estimated
人形机器人 世界行动模型 移动-操控 隐空间预测 家庭机器人

ω-0 是一种全身世界行动模型,使单一人形机器人策略能够根据语言指令和视觉观测,在移动、调整姿态、保持平衡的同时完成物体操控。它不重建未来视频,而是学习紧凑的隐空间未来观测嵌入,并与基于扩散的全身动作生成耦合,再通过基于控制器的仿真回放将人类运动先验落地为可执行的行动隐变量。基于新构建的 40 多小时 ω-HOME 数据集,单一模型即可在 11 项真实家庭任务上生成流畅的边移动边操控行为,持续超越模仿学习、VLA、人形机器人与世界行动模型基线。

原文 · arXiv:2608.06375

背景

真实的人形机器人家务几乎从不被拆解为“先走到某处、停下、再操作”的串行流程。整理桌面、端菜、收纳物品等任务都要求机器人在移动、调整姿态的同时伸手、抓取并保持平衡,即并发的移动-操控(loco-manipulation)。现有的人形策略通常把运动与操控拆成两个难以协调的模块,而近期的世界行动模型要么只关注机械臂,要么侧重生成未来视频而非可执行的控制。这使家庭场景中的人形机器人缺少统一的“全身、语言引导”控制方案。

核心创新

ω-0 是一个隐空间预测的全身世界行动模型。给定语言指令、当前视觉观测与本体感受状态,它直接预测与控制器兼容的全身行动隐变量,供真实机器人执行。其设计有两个突出之处:其一,它不采用视频世界模型惯用的未来视频重建目标,而是学习紧凑的未来观测嵌入作为轻量预测目标,将隐空间视觉前瞻与基于扩散的全身动作生成耦合;其二,通过基于控制器的仿真回放,把人类与公开的视觉-运动先验落地为机器人可执行的行动隐变量,弥合人类示教数据与真实机器人动力学之间的鸿沟。模型支持第一视角 RGB、第三视角 RGB 与第三视角深度输入,并基于 ω-HOME 数据集训练——该数据集包含 40 多小时的真实家庭人形数据,带有同步多视角观测、全身 SMPL 运动、机器人状态与行动隐变量。

结果

在 11 项真实家庭任务上的实验表明,单一 ω-0 模型即可生成流畅的边移动边操控行为,并一致优于具有代表性的模仿学习、VLA、人形机器人与世界行动模型基线。评估覆盖的是真实的并发移动-操控场景,而非孤立的抓取-放置任务;统一模型无需按任务单独微调。多视角、多模态的输入支持也表明该方法在不同相机配置下具备较好的鲁棒性。

局限

论文结论建立在单一模型族与单一团队采集的数据集之上,跨实验室的可复现性尚未得到验证。摘要报告的是相对基线的优势,未给出各任务的成功率明细、失败模式或对语言指令质量的敏感性分析。40 多小时的数据库虽规模可观,但相对真实家庭环境的多样性仍然有限;同时,基于控制器回放的落地效果依赖于训练所用仿真的保真度。

产业启示

并发移动-操控是区分“可进家庭的机器人”与“实验室演示”的关键能力:折叠衣物、取物、清洁、端送餐食都需要边移动边操作。单一策略直接从语言与视觉输出控制器兼容的全身动作,缩短了从示教数据到部署行为之间的距离,也免去了拼接独立运动栈与操作栈的工程负担。该工作发布的多视角家庭数据集(含 SMPL 与机器人状态标注)对整个长期数据匮乏的人形机器人生态同样价值显著。对人形机器人创业公司与集成商而言,这是一个强烈信号:统一的全身世界行动策略正在走向真实家庭部署。