面向视觉-语言-动作模型的频率条件流匹配

· 编辑团队 estimated
VLA 流匹配 动作生成 频率条件 机器人操作

机器人动作是时间上相关的轨迹,其频率分量在不同尺度上编码运动,能量分布高度不均;而基于流匹配的视觉-语言-动作(VLA)模型通常在时间坐标中生成动作,并未显式建模或系统利用这种频率异质性。本文提出 FreqFM,一种面向 VLA 的频率条件流匹配框架:它把动作频率从轨迹的隐式属性提升为贯穿整个生成流程的显式条件维度。具体而言,在 DCT 频率坐标下,FreqFM 构造谱匹配的源分布、自适应地在各频率之间平衡训练目标,并用对应的参考传输尺度约束逐频率的引导残差。FreqFM 可无缝接入现有流匹配动作专家而不改动 VLA 主干,在 LIBERO、LIBERO-Plus 与 VLA-Arena 上一致提升,其中 LIBERO-Plus 提升 9.3 个百分点,并在六个真实机器人任务上验证有效。

原文 · arXiv:2609.10405

流匹配(Flow Matching)已经成为视觉-语言-动作模型里主流的动作生成方式:它在噪声与目标动作之间学习一个连续的速度场,用若干步去噪把随机噪声「流」成一段动作轨迹。几乎所有实现都在时间坐标里做这件事——把动作序列的每个时间步当作独立维度处理。但机器人动作并不是各时间步独立的随机量,而是时间上强相关的轨迹:其中高频分量承载接触瞬间的精细修正,低频分量决定整体的运动趋势,二者的能量分布高度不均。把这种结构当作背景噪声忽略掉,等于让模型把训练容量平摊在一个严重偏斜的频谱上。

核心创新

FreqFM 的核心主张很直接:让频率成为一等公民。它把动作频率从一个隐式的轨迹属性,提升为贯穿整个生成流程的显式条件维度,具体落在三个环节:

  1. 谱匹配的源分布:不再用各向同性的高斯噪声,而是在 DCT 频率坐标下构造与目标动作频谱相匹配的源分布,让去噪起点就已经带着正确的频率结构。
  2. 自适应目标平衡:在各频率之间自适应地重新加权训练目标,避免高能量频段主导梯度、低频结构欠拟合。
  3. 逐频率引导残差约束:用每个频率对应的参考传输尺度来约束引导残差,使条件引导在高频与低频上保持一致的尺度。

工程上最重要的一点是:FreqFM 不改变 VLA 主干,而是作为一个可插拔模块接入现有的流匹配动作专家。这意味着它是一条低风险的升级路径,而非重写模型。

实验结果

  • LIBERO、LIBERO-Plus 与 VLA-Arena 上均取得一致提升。
  • 其中在 LIBERO-Plus 上提升 9.3 个百分点
  • 六个真实机器人任务上进一步验证了方法的有效性。

局限性

摘要未给出各基准上的完整数值、与其它动作生成改进方案(如不同的噪声调度或引导策略)的对比,也未报告频率条件化带来的额外计算与参数开销。增益在 LIBERO-Plus 这类强调扰动与泛化的基准上最为显著,但具体任务类型与失败模式未被细述;真实机器人任务的数量、难度与成功率同样未量化,因此「六个真机任务」的泛化边界仍不清晰。

行业影响

动作生成的频率结构是运动控制里的通用问题,不限于某一类机器人:「低频决定去哪、高频决定怎么碰上」几乎是所有接触式操作的共同规律。把这一结构显式建模、且以可插拔模块的形式落地,意味着已经部署的 VLA 系统可以用很小的改动获得提升,而不必重训主干。对追求精细操作成功率、又受限于算力与迭代成本的团队,这类「改接口不改模型」的工作具有直接的工程价值。