RoboSPA:VLA模型能否超越简单场景与短视距任务?
RoboSPA(机器人空间-程序化评估)是一个大规模机器人操作数据集与诊断基准,用于检验VLA模型在空间与程序复杂度递增条件下的具身推理能力。基准聚焦两个核心维度:细粒度空间推理与长时程程序化规划,覆盖10个任务类别、56个基础任务,每个任务在五个难度级别上实例化,共280个变体,空间歧义与程序复杂度逐级递增。数据规模为527K条轨迹,覆盖多种本体与多样场景。除二值成功率外,RoboSPA引入诊断性指标进行更细致的评估。对代表性VLA模型的实验显示,现有系统在复杂空间关系、精确低层执行与记忆密集型规划上仍力不从心,确立了RoboSPA作为开发更强、更可靠、更泛化具身智能体的挑战性诊断基准,数据与代码已公开。
原文 · arXiv:2609.05324视觉-语言-动作(VLA)模型在语言条件化机器人操作上进展迅速,但现有数据集与基准大多只在预设初始条件下考核”任务是否完成”,很少回答一个更根本的问题:当空间关系变复杂、任务链条变长时,模型的推理能力究竟在哪个环节失效?LIBERO等基准上接近满分的高分既可能说明能力,也可能掩盖评测设置过于理想的事实。RoboSPA正是为诊断这类”高分下的短板”而设计。
核心创新
RoboSPA把评测对象从任务完成率转向两项核心能力:细粒度空间推理与长时程程序化规划。它包含10个任务类别、56个基础任务,每个任务在五个难度级别上实例化,形成280个空间歧义与程序复杂度递增的变体;数据规模达527K条轨迹,覆盖多种本体与多样场景。与多数基准只报二值成功率不同,RoboSPA引入专门的诊断指标,用于定位模型在哪个推理环节退化——是空间关系理解、低层精确执行,还是依赖记忆的长程规划。
实验结果
- 对代表性VLA模型的系统性评测显示:现有系统在复杂空间关系、精确低层执行与记忆密集型规划上仍然吃力。
- 诊断指标能够区分不同维度的失败模式,而非只给出单一成功率。
- 数据与代码已在 GitHub(fanzhenxuan/RoboSPA)公开。
局限性
摘要未点名具体评测了哪些VLA模型、各模型在不同难度级别上的成绩分布,增益与差距的量化细节需查阅论文。527K条轨迹的采集方式(遥操作、示教还是仿真)与本体构成未在摘要说明;难度级别的划分带有一定主观性。作为纯基准贡献,论文不提供改进方法,其价值取决于社区后续是否围绕诊断结果形成方法迭代。
行业影响
对投入具身智能的公司而言,基准即路线图:RoboSPA把”任务成功率虚高”这一行业性焦虑量化成了可定位的推理缺陷,为数据采集与模型选型提供了更细的标尺。对构建通用机器人策略的团队,其”难度递增+诊断指标”的评测范式可直接迁移到自身的数据飞轮与模型验收流程中,帮助在部署前识别空间推理与长程记忆上的真实短板。