Show-Harness:一个 VLM Agent 就能「玩」机器人
Show-Harness 提出一种「具身载体」接口,把基础视觉语言模型(VLM)的世界知识转化为机器人控制能力:它向 VLM 暴露一组离散的语义动作单元供其自然推理,再由本体相关的解释器确定性地把这些单元落地为局部机器人动作,使 VLM 直接对细粒度物理决策负责。同一接口既能零样本解锁闭源前沿 VLM 的机器人控制,也能用数 GPU 小时微调小规模开源 VLM 以实现低成本部署;配套的 GUMI(图形界面操作接口)把同一语义动作空间扩展到基于 GUI 的示教采集,让人与智能体无需专用遥操作硬件即可跨本体「玩」机器人。大量实验显示,搭载 Show-Harness 的 VLM 智能体在任务、本体与环境间稳健泛化,优于代表性 agentic 与 VLA 范式。
原文 · arXiv:2609.10522基础视觉语言模型已经「知道」很多关于世界的事:它们能描述物体、理解指令、对场景中的因果关系作出合理推断。但把这些知识变成机器人动作,一直是最难的一步。主流做法是端到端的视觉-语言-动作(VLA)模型——把感知与动作直接压进同一策略——但这需要为每个本体做昂贵的预训练或大规模演示采集,而且策略一旦面对略微超出训练分布的场景就容易失效。
核心创新
本文的出发点是:或许缺的不是模型容量,而是一个正确的接口。Show-Harness 是一个「具身载体」,它在 VLM 与机器人之间架起一层紧凑的语义接口:VLM 面对的不再是连续的关节角或末端位姿,而是一组离散的语义动作单元,可以像处理语言一样自然地对其推理;随后,本体相关的解释器把这些高层决策确定性地「落地」为具体机器人动作。关键在于分工——VLM 仍直接对细粒度的物理决策负责,解释器只负责把语义决策翻译成特定本体的执行。
这一接口带来两条实践路径。其一,直接解锁闭源前沿 VLM 用于零样本机器人控制:不需要访问模型权重、不需要针对机器人的微调。其二,用小规模开源 VLM 微调实现低成本部署:只需数 GPU 小时即可适配。
论文还给出 GUMI(GUI Manipulation Interface),把同一套语义动作空间扩展到基于图形界面的示教采集:人与智能体都可以像「玩游戏」一样跨本体地操作和示教机器人,从而绕开专用遥操作硬件的门槛。
实验结果
- 搭载 Show-Harness 的 VLM 智能体在任务、本体与环境上展现出稳健的泛化能力。
- 在对比中优于代表性的 agentic 范式与 VLA 范式。
- 研究结论是:正确的接口就能从基础 VLM 中释放出可观的具身能力,无需额外的模型容量或昂贵的本体专属预训练。
局限性
摘要是概念性陈述,未给出各任务的具体成功率、任务数量、基线配置与硬件平台,因此相对 VLA 基线的领先幅度难以量化。语义动作单元的粒度与覆盖范围、以及解释器的覆盖能力,共同决定了整套系统的能力上限——遇到未被动作单元覆盖的场景,VLM 再强也无从表达。摘要也未讨论 VLM 推理延迟对控制频率的影响,以及这种类「游戏」接口在安全关键场景下的失效模式。
行业影响
如果结论成立,其价值不在于刷新某个基准,而在于改变部署的经济学:不必为每个新本体重训一个大策略,而是复用已经很强的基础 VLM,通过接口把它「接」到机器人上。这既压低了适配成本,也让闭源前沿模型第一次可以合法、便利地进入机器人链路。对做多本体产品线的团队,以及苦于遥操作硬件昂贵、示教数据采集慢的团队而言,这类「用接口换能力」的思路值得认真评估。