StellaVLA:上下文结构化演示驱动的可泛化视觉-语言-动作模型
StellaVLA在测试时仅凭一条检索到的演示即可完成分布外适应:离线管线将原始轨迹自动转化为任务计划、子目标描述与口语化3D动作等结构化演示,作为上下文指导让策略“理解任务”而非“模仿像素”。在VLA-Arena排行榜(2026-08-01)以0.63总分登顶(π0.5为0.44),LIBERO平均成功率98.8%,且推理阶段零额外延迟。
原文 · arXiv:2608.11671VLA模型能够遵循指令并操作物体,但当场景、视角或物体偏离训练分布时,性能往往急剧下降。传统的应对方式是针对每个新环境重新采集数据并微调,成本高昂且难以规模化。StellaVLA提出的是一条不同的路径:在测试时仅凭一条检索到的演示完成适应,完全不需要重新训练。
核心创新
StellaVLA的关键洞察是“超越模仿专家做了什么,转而传达为什么这样做”。一条离线自动化管线以零人工标注成本,将原始轨迹转化为结构化演示——例如任务计划、子目标描述、口语化的3D动作描述。这些结构化信息作为上下文指导提供给策略,使其能够“推理任务”而非“模仿像素轨迹”,因此天然具备跨具身迁移能力:真实机器人、人手的视频演示、以及XR采集的人到机器人演示均可直接使用。
训练采用并行的双目标设计:联合动作与语言目标将这种推理内化到策略中,而推理阶段仅使用动作专家分支,保持实时、高频控制且不增加任何延迟。
实验结果
- VLA-Arena排行榜(2026年8月1日)综合得分0.63,排名第一,对比π0.5的0.44与LingBot-VLA的0.22;
- LIBERO平均成功率98.8%,LIBERO-Plus成功率85.1%;
- 真实机器人基准验证:人类演示、机器人演示与人到机器人(XR)演示均可作为上下文结构化演示,帮助VLA模型适应分布外任务。
局限性
排行榜与基准数字来自论文自报;抽象层面未披露单条演示的检索来源与检索失败时的行为,测试时适应效果依赖于环境中存在相关演示可供检索。单演示条件下的长时程任务与完全未知任务的泛化上限仍需进一步验证。
行业影响
免微调的测试时适应直接削减了数据采集与重训成本,而人手视频与XR演示的复用更是为数据收集提供了新的低成本渠道。推理阶段零附加延迟意味着该方案可以直接部署在高频控制回路中,对人形机器人、通用操作等场景的落地具有现实意义——这可能是“以一条演示换一个任务”的VLA商业化路径中非常实用的一步。