G0.5:单自回归流统一机器人推理与动作生成

· 编辑团队 estimated
具身智能 VLA 自回归模型 机器人基础模型 推理与动作

G0.5将推理与动作生成统一到单一自回归Transformer解码器中,推理token与动作token在同一目标下联合生成;在7个独立评测场景中全面超越现有SOTA,包括真实机器人微调(R1lite/R1pro上76.7%对π0.5的53.3%)、2025 BEHAVIOR挑战赛、DROID零样本迁移(82.5%)与LIBERO(98.9%)。

原文 · arXiv:2608.11739

当前主流的视觉-语言-动作(VLA)模型配方,是将预训练视觉语言模型(VLM)与一个单独训练的动作流匹配专家耦合在一起。这种设计把VLM降格为“上下文编码器”,真正的决策由动作专家完成,模型的推理能力与物理行为之间被割裂。G0.5试图打破这一结构:让同一个Transformer解码器既生成推理token,也生成动作token,在单一训练目标下完成决策与执行。

核心创新

G0.5是一个预训练的自回归VLA模型,其核心是三个组件:

  • 跨具身动作分词器:可学习的分词器将异构机器人动作映射到共享的词表,使不同形态(人形、机械臂等)的动作可以统一建模;
  • 原生思维链流:任务分解、物体定位、动作提示等推理token与动作token交织在同一序列中,模型在“想清楚”之后再“动手”;
  • 视觉记忆模块:通过视觉编码器注入数秒级的历史信息,为长时程决策提供上下文。

由于推理与动作共享同一套权重,预训练VLM的既有能力可以直接迁移到物理行为上:模型严格遵循指令,且无需额外训练,仅通过提示词即可调节动作粒度、任务时域以及对分布外场景的处理方式。

实验结果

模型在大规模机器人数据集与VQA样本上联合预训练,在7个独立评测场景中均超越SOTA:

  • 真实机器人微调:R1lite/R1pro上76.7%,对比π0.5的53.3%与GR00T-N1.7的24.4%;
  • 2025 BEHAVIOR挑战赛:50个长时程家庭移动操作任务上,通用策略取得31.4%,高于π0.5的26.3%与当届冠军的26.1%;
  • DROID后训练+零样本迁移:在未见环境与物体上达到82.5%;
  • LIBERO 98.9%、RoboTwin 2.0 93.3%、SimplerEnv-Bridge 87.3%,以及语言跟随的抓放基准。

局限性

评测数字均来自论文自报,真实机器人部分集中于R1lite/R1pro平台;基准多为仿真环境,跨平台真实部署的稳定性仍需验证。论文未披露基座规模训练的具体算力与数据配比,其他团队复现门槛可能较高。

行业影响

单流架构简化了VLA的训练与部署管线——不再需要单独训练动作专家,推理与动作的联合学习让指令遵循和分布外处理能力显著增强。对人形机器人厂商而言,提示词即可调节行为粒度意味着无需为每个任务重新训练,大幅降低迭代成本;这也为“通用机器人基座模型”的商业化路径提供了更强的证据。