MATE:面向人形机器人协作数据采集的多操作者虚拟遥操作平台
人形机器人需要关于协作的具身经验,但真机多机器人数据采集无法规模化:它需要多台机器人、专用场地,还要反复重置。MATE 用共享物理仿真替代硬件,让多位地理位置分散的操作者同时遥操作全身人形机器人,同时保留了人形机器人、物体与环境之间真实物理耦合的交互——而这恰恰是协作数据价值的来源。借助 MATE,作者构建了包含 24.1 小时、2500 个联合回合、五类长时序任务的多机协作数据集,覆盖物体交接、接力配送、环境交互与协同搬运;并提出 EAIS(执行对齐的交互采样)策略,优先采样推进任务进度与交互关键的行为。基于该数据训练的模仿学习与视觉语言动作策略学习效果良好,并能零样本迁移到实体人形机器人,无需真机微调。
原文 · arXiv:2609.26520人形机器人的移动操作与协作技能来自具身经验,而协作恰恰是最难规模化采集的那部分。给单台人形机器人采数据已经意味着硬件、场地与反复重置;让两三台人形机器人围绕同一个物体交互协作,则意味着前面所有这些成倍增加,外加必须把每位操作员、每台机器人排进同一时间的同一个房间。结果是多机人形数据长期稀缺,而最需要这类数据的任务——把物体递给同伴、合力搬运、对另一个智能体的身体做出反应——恰恰是单智能体流程无法凭空合成的。MATE 的立场是:交互必须是物理的,但硬件不必是。
核心创新
- 同一共享物理环境中的分布式多操作者遥操作。 多位身处不同地点的操作者,在同一个基于物理的场景中控制全身人形机器人。人形机器人之间、以及它们与被操作物体、环境之间的物理耦合被保留下来,因此采集到的演示包含真实的接触与协同,而不是脚本化播放。
- 不需要机器人编队、不需要同地部署、不需要反复的真机重置。 多机采集中昂贵的部分被去掉,而交互结构被保留——正是这一点让平台能够支撑长时序协作技能。
- EAIS:执行对齐的交互采样。 在回合中执行对齐的前缀范围内计算采样信号,优先采样推进任务进度与交互关键的行为,从而把训练权重集中到真正发生协同的时刻,而不是均匀摊到很长的回合上。
- 为「可学习」而构建的协作数据集。 24.1 小时的协同行为、2500 个联合回合、五类长时序任务,包括物体交接、接力配送、环境交互与协同搬运等。
实验结果
- 规模:通过多操作者虚拟遥操作构建的多机人形协作数据集,包含 24.1 小时、2500 个联合回合 与 五类长时序任务。
- 策略学习:在该数据上训练的代表性模仿学习与视觉语言动作策略,在多类协作任务上都学得起来,EAIS 改善了从交互密集演示中的学习效果。
- 迁移:策略能够 零样本从虚拟演示迁移到实体人形机器人,且无需真机微调;作者同时把「数据采集效率」表述为该平台的实用属性。
局限性
摘要没有说明一次会话涉及几台人形机器人、几位操作者,迁移验证用了几台实体机器人,也没有给出迁移后行为的成功率。零样本迁移的结论没有配上量化的虚实性能差距,而这个数字才决定平台到底能替代多少真机数据。分布式操作者之间的遥操作质量本身也是变量:延迟、操作熟练度、遥操作硬件的差异都会塑造演示数据,这些都没有被刻画。论文也没有与真机多机器人采集的数据做对比,因此虚拟介质带来的保真度代价没有被测量;长时序任务只按任务族给出,没有逐任务成功率或失败恢复行为。
行业影响
协作型人形机器人的实际瓶颈不是模型容量,而是「协同多机演示」的供给,而现有的每一条供给路径都是重资产的:更多机器人、更大场地、每个会话更多的操作工时。一个既保留物理耦合、又去掉了机器人编队的虚拟平台,把数据采集从硬件项目变成软件项目,这类转变往往决定了小团队能否参与。真正悬而未决的是虚实迁移的账:如果零样本迁移能在可用的成功率上成立,仿真多机采集就会成为协作技能默认的获取渠道;如果它仍需一轮真机数据修正,平台依然更便宜但不再免费,而两者之间的比例就成了决定性的运营指标。