Reflex:基于流式推理的实时VLA控制
Reflex通过利用时间步不变性(timestep-invariance)属性,实现了流匹配VLA策略的实时流式推理,在标准基准上达到2.58倍加速和50Hz稳定流式输出。
原文 · arXiv:2607.14695流匹配(Flow-matching)视觉-语言-动作(VLA)模型为机器人操作提供了精确的连续控制能力,但其迭代去噪特性与实时部署存在根本性矛盾:全局时间步注入使键值(KV)缓存失效,迫使开发者要么接受昂贵的O(N²)重计算,要么采用数学上不正确的缓存复用。Reflex通过利用时间步不变性——即流匹配策略中的感知编码器独立于去噪循环——打破了这一困境。
核心创新
Reflex的关键洞察是将注意力上下文划分为三个区域:静态区(持久视觉特征)、滑动区(最近观测)和动态区(去噪步特有信息)。这一划分实现了O(1)增量缓存更新,同时为固定输入保持与全批量等价的注意力输出。该架构使得模型可以在多个去噪步骤间复用KV缓存而无近似误差,直接解决了流匹配策略推理缓慢的根本原因。
为确保连续高频推理中的数值稳定性,Reflex引入了AdaRMSNorm——一种自适应归一化层,通过流相位门控来防止BFloat16数值崩溃(在数百个连续去噪步骤的生产环境中尤为突出)。异步流水线将视觉编码与动作生成解耦,操作符融合则减少了内核启动开销。
实验结果
在LIBERO和Kinetix基准上,Reflex实现了:
- 相比标准流匹配VLA实现2.58倍推理加速
- 50Hz稳定流式输出,支持实时控制回路闭环
- 延迟最高降低54%,对动态操作任务至关重要
- 任务成功率与全批量推理相比无下降
值得强调的是,这些提升无需改动底层策略架构——Reflex在推理引擎层面运作,可广泛适用于任何流匹配VLA模型。
局限性
时间步不变性在测试基准上经过了实证验证,但缺乏形式化的理论证明。当前实现针对基于Transformer的流匹配架构的特定KV缓存结构;对其他去噪范式(如一致性模型)的适用性尚未验证。真实环境部署在7自由度Franka机械臂上完成,但仅限于受控实验室环境。
行业影响
这项工作直面VLA模型从研究展示走向生产机器人系统的最关键瓶颈:实时推理。随着机器人行业越来越广泛地采用VLA策略进行通用操作,Reflex提供了一条在控制回路频率下运行这些计算密集型模型而无需专用硬件的路径。迭代策略的KV缓存复用这一工程贡献可直接应用于任何部署流匹配模型的组织——从仓储自动化到手术机器人。