HumanCLAW:视觉语言模型能否通过身体行动?
HumanCLAW 提出了一种将动作决策与运动执行解耦的具身 AI 评估框架,在 41 个场景中的 1,218 个第一人称“寻找-导航-交互”长程任务上评估了 9 个最先进的 VLM。最佳模型仅达 16.8%——揭示了当前 VLM 从根本上缺乏具身自我意识。
原文 · arXiv:2607.27180背景
评估视觉语言模型(VLM)能否通过物理身体执行动作存在根本性挑战,因为任务结果耦合了 VLM 的决策与运动控制。当任务失败时,无法区分是 VLM 做出了错误选择还是运动控制器执行失败——例如失去平衡而摔倒。这种耦合掩盖了具身 AI 的核心问题:当前的 VLM 是否理解自身的物理存在?
核心创新
HumanCLAW 是一种将动作决策与底层运动执行清晰解耦的评估框架。每一步中,一个被”驾驭”的现成 VLM 发出一个原子技能命令(如”向前走”、“抓取物体”)。该命令被转化为具有真实物理后果(重力、碰撞、平衡)的亚秒级连续全身运动片段,同时将执行侧的干扰、运动误差和平衡失败因素剥离。剩下可测量的就是模型的纯粹动作智能:它对身体下一步应该执行什么的即时选择。
基于这一框架,作者构建了 HumanCLAW-Bench:涵盖 41 个室内场景的 1,218 个第一人称”寻找-导航-交互”长程任务。
实验结果
测试了九个最先进的 VLM,没有一个能解决该基准。最佳模型仅达到 16.8% 的成功率。关键的是,作者表明识别目标物体并非瓶颈——VLM 能够辨识需要交互的物体。它们缺乏的是具身自我意识:无法跟踪自身身体的位置,无法判断是否已到达目标,也无法检测是否撞上了障碍物。VLM 的表现就像脱离躯体的观察者在发出指令,而非栖居于物理形态中的智能体。
局限性
基准测试使用简化的原子技能命令而非连续的低级控制,这可能低估了实时全身协调的需求。41 个室内场景虽然多样,但仍为模拟环境。该框架需要物理仿真后端,可能在动作执行层引入仿真到真实的差距。
行业影响
HumanCLAW 为具身 AI 开发提供了一种急需的诊断工具。对于构建人形机器人或需要在物理世界中导航的虚拟智能体的公司,它精准定位了当前 VLM 失败的核心能力缺口——具身自我意识。弥合这一缺陷需要根本性的新架构设计而非简单扩展现有 VLM,这为研究投资方向提供了指引。感知级和动作级失败的清晰分离也使 HumanCLAW 成为具身 AI 团队有价值的回归基准测试。