RynnBrain 1.1:迈向更强大、更通用的具身基础模型

· Editorial Team estimated
具身基础模型 VLA 人形机器人 跨本体操作

RynnBrain 1.1 发布涵盖 2B 至 122B 参数的具身基础模型家族,新增接触点预测与原生 3D 定位能力,在 VSI-Bench、MMSI、RefSpatial-Bench 等基准上超越所有开源及商业模型,并在 Unitree G1、Astribot-S1、天玑无极三款机器人上完成跨本体 VLA 部署验证。

原文 · arXiv:2607.17977

背景

具身基础模型旨在为机器人提供通用的感知、空间推理、定位与规划能力。然而,此前模型在处理精细操作任务时缺乏对接触点的显式建模,且不同本体之间的动作空间差异使得单一模型难以直接迁移到多种机器人平台上,制约了模型的实用性和通用性。

核心创新

RynnBrain 1.1 在 1.0 版本基础上引入两项关键改进:接触点预测(contact-point prediction)——模型能够预测末端执行器与物体之间的预期接触位置,使输出更直接服务于操作任务;原生 3D 定位(native 3D grounding)——面向 2B 和 9B 模型,将空间推理从隐式编码升级为显式的三维坐标预测。这两个能力显著提升了模型在操作任务中的精准度。

新发布的 RynnBrain-VLA 采用统一跨本体动作空间配合本体特定掩码(embodiment-specific masking),实现了在 Unitree G1(人形机器人)、Astribot-S1(双臂桌面机器人)和天玑无极(全尺寸双臂人形)上的直接部署。

实验结果

122B-A10B 版本在 VSI-Bench(视觉空间智能)、MMSI(多模态空间理解)和 RefSpatial-Bench(参考表达空间定位)三个权威基准上全面超越评估过的所有商业及开源模型。真实机器人实验表明,RynnBrain 初始化的策略在成功率与过程得分上均优于基于 Qwen 的代表性通用 VLA 模型;联合多任务、多本体训练相比单任务训练进一步提升了整体表现。

局限性

论文未详细讨论 122B 模型的推理延迟与计算成本;跨本体动作空间统一方案在大规模本体库上的可扩展性仍有待验证;接触点预测在当前版本中主要服务于静态抓取,动态操作场景下的表现未知。

行业影响

RynnBrain 1.1 证明了具身基础模型的规模化路径——更大容量的模型、跨本体训练与结构化的空间输出可以产生协同增益。其对多本体的统一部署能力为工业与服务人形机器人提供了一条可行的技术路径。