RoboTTT:上下文长度缩放——机器人策略模型的新维度
NVIDIA联合斯坦福大学团队提出RoboTTT,首次将机器人视觉-语言-动作策略的上下文窗口扩展至8000时间步,实现从人类视频演示中一次性模仿学习、在线策略改进以及长时序复杂装配任务的完全自主完成,性能较单步基线提升87%。
原文 · arXiv:2607.15275RoboTTT:上下文长度缩放——机器人策略模型的新维度
研究背景
当前机器人基础模型普遍采用单步或短历史窗口作为视觉运动输入,极大限制了模型对长时序任务的感知与规划能力。面对需要连续决策的多阶段操作任务(如装配、护理、精密制造),短上下文窗口意味着模型缺乏足够的历史信息来做出正确判断,导致任务失败率居高不下。
核心创新
来自NVIDIA GEAR Lab与斯坦福大学的联合研究团队提出了RoboTTT(Test-Time-Training Robot Policies),将测试时训练(Test-Time Training, TTT)技术嵌入到视觉-语言-动作(VLA)策略模型中,实现了革命性的上下文长度缩放。
技术突破主要体现在三个层面:
-
上下文窗口扩展至8000时间步:较现有最先进策略提升三个数量级,且推理延迟不随上下文增长而增加。核心思路是将梯度下降更新的快速权重作为序列模型的循环状态,使历史信息被压缩到权重空间中,从而实现超长上下文的有效检索。
-
训练策略创新:结合”序列动作强制”与”截断时间反向传播”,解决了超长序列训练的收敛难题,使得上下文长度本身成为可有效扩展的训练维度。
-
全新的机器人能力涌现:长上下文窗口带来了此前无法实现的能力——从人类视频演示中进行一次性上下文模仿学习、策略在线即时改进、对抗干扰的鲁棒性,以及在多阶段长时序任务上的显著性能提升。
实验结果
在真实机器人操作任务中,RoboTTT整体性能较单步上下文基线提升87%,并首次完整完成了一项五分钟、十阶段装配任务——所有基线方法均未能完成该任务。特别值得关注的是,使用8000时间步上下文训练的模型,其性能比同架构下使用1000时间步预训练的模型高出62%,明确证明了上下文长度作为机器人基础模型新缩放维度的有效性。
行业价值
RoboTTT的提出标志着机器人学习范式的重要转变:从”更大的模型、更多的数据”的简单扩展,转向”更长的上下文、更强的记忆”这一新维度。对于工业界而言,这意味着:
- 简化示教流程:操作人员只需录制一段人类演示视频,机器人即可一次性学会模仿,大幅降低编程与示教成本。
- 在线自适应能力:机器人在执行过程中可即时改进策略,适应环境变化,减少产线停机时间。
- 复杂装配自动化:长时序多阶段装配任务的自动化成为现实,对制造业柔性生产具有里程碑意义。
该工作由NVIDIA GEAR Lab主导,论文作者包括Yunfan Jiang、Yevgen Chebotar、Ruijie Zheng、Fengyuan Hu、Yunhao Ge、Jimmy Wu、Tianyuan Dai、Scott Reed、李飞飞、朱玉可和范麟熙(Jim Fan)等知名学者。