FolDeX:面向可形变物体长时程机器人操作的真实世界基准

· 编辑团队 estimated
基准测试 可形变物体 衣物折叠 真机数据 具身智能

FolDeX是一个完全基于真机数据构建的真实世界基准,以衣物折叠为核心任务,面向长时程可形变物体操作——策略须跟踪不断变化的状态并执行可靠的多阶段双臂交互。鉴于真机数据采集成本高昂,该基准围绕四条研究轴考察异构物理经验的高效复用:利用部署中采集的人类干预与恢复数据;跨任务迁移(含衣物类别之间及刚体到可形变物体);跨场景复用(光照、背景与布局变化);以及跨本体迁移。基准提供2000+小时真机数据,覆盖20+任务与10+本体,并给出对外部提交策略的公平评测平台:标准化任务、留出实物、受控初始化与统一执行协议。

原文 · arXiv:2609.10243

具身智能有一个评测难题。视觉—语言—动作模型与「世界—动作」模型在仿真中成绩亮眼,一到真机上却大幅退化——在长时程可形变物体操作上尤其如此,因为策略必须在多阶段双臂交互中始终维持对不断变化的布料状态的认知。而现有能暴露这类失败的真机基准,大多集中在短时程刚体物体任务上。可形变操作以及其背后的数据经济学,长期缺乏基准。

核心创新

FolDeX是一个完全基于真机数据构建的真实世界基准,以衣物折叠为核心任务。它没有再造一个仿真器,而是直面核心现实约束:真机数据昂贵,因此领域必须理解如何高效复用异构物理经验。基准围绕四条研究轴组织:

  • 人类干预与恢复数据——在部署过程中采集,把真实操作中那些凌乱的纠错时刻转化为监督信号。
  • 跨任务迁移——含衣物类别之间,以及从刚体到可形变物体的迁移。
  • 跨场景复用——在光照、背景与布局变化下复用。
  • 跨本体迁移

四条轴共同把该数据集变成研究数据效率的实验室,而不只是一张排行榜。

实验结果

  • 2000+小时真机数据。
  • 20+任务10+本体
  • 面向外部提交策略的公平真机评测平台:标准化任务、留出实物、受控初始化,以及统一执行协议
  • 平台公网可访问:**https://ai.midea.com/#/fold-challenge**。

局限性

摘要描述了基准的构建方式与研究轴,但未给出任何量化基线或成功率,因此其区分不同策略的能力在摘要中尚未得到证明。覆盖范围集中于衣物折叠;尽管「刚体到可形变」是一条研究轴,基准在服装之外的广度仍不明确。与任何托管式挑战赛一样,可复现性取决于实体平台与留出实物的持续可用性。

行业影响

对通用机器人策略而言,瓶颈正日益从模型架构转向数据。一个经过整理、覆盖多本体多任务、包含2000+小时真实折叠数据的语料库,再配上标准化的留出评测协议,正是让领域能够诚实比较策略的共享基础设施,也是让机器人机队有限的研究者得以「搭车」他人物理经验的关键。对研发洗衣、纺织、包装等任何可形变流程操作策略的企业而言,FolDeX勾画了它们所需的数据复用范本。