GeoAAC:用去噪轨迹的几何形状,给 VLA 策略自适应决定动作块长度
动作分块(action chunking)已成为视觉-语言-动作(VLA)策略生成与执行动作的常规做法,但现有方法普遍使用固定的动作时域。同一次执行中,不同任务阶段对动作连续性、控制精度与闭环反馈的需求并不相同,固定时域无法适应这种变化。作者提出 GeoAAC:一种面向流匹配(Flow Matching)式 VLA 策略、基于几何的自适应动作分块方法,按当前动作预测的可靠程度调整动作时域。其核心观察是,流匹配去噪轨迹的几何形状提供了刻画预测可靠性的过程级信息——动作前缀之间的几何变化量与预测不确定性正相关。GeoAAC 用这种前缀级几何构造「时域级几何剖面」,在单次生成内自适应确定动作时域,且不需额外训练。在 GR00T N1.5 与 π0.5 上、于 LIBERO、LIBERO-Pro、RoboCasa365 及真实机器人操作任务上的实验显示,方法一致优于固定时域基线与已有自适应方法:仿真中最多提升 8.7 个百分点,真实世界平均成功率从 53.3% 提升到 74.4%。
原文 · arXiv:2609.20776动作分块已经成为视觉-语言-动作(VLA)策略的默认做法:策略不是逐步输出单个动作,而是一次生成一小段动作序列再成段执行。它带来更平滑的运动和更低的推理频率,但也带来一个几乎没人愿意细想的超参——这段序列该有多长。
现有方法基本都用固定时域(fixed action horizon)。可问题在于,同一次执行里,不同任务阶段的需求并不一样:接近目标时需要更细的控制精度和更频繁的闭环反馈,长距离移动时则希望动作更连续、少些抖动。一个固定值无论取大取小都只能在一部分阶段上合适——而这个值通常靠人工扫参定下来,换个任务往往还要再调一次。
核心创新
GeoAAC 的出发点是:预测本身是否可信,可以让生成过程自己说出来。
作者针对的是基于流匹配(Flow Matching)的 VLA 策略——这类策略通过对一个学到的速度场做积分来生成动作块。他们发现,去噪轨迹的几何形状携带过程级信息:动作前缀之间的几何变化量,与预测不确定性呈正相关。换句话说,模型在哪些前缀上「拿不准」,在几何上是可以看出来的。
据此构造出时域级几何剖面(horizon-wise geometric profile):用前缀级几何信息刻画不同候选时域的可靠性,进而在单次生成中自适应确定动作时域。
关键特性是不需要额外训练:方法直接作用在已有策略上,不引入新参数、不改权重,也不需要为每个任务重新标定。相对于「再训一个更聪明的策略」,这是一条成本极低的改进路径。
实验结果
- 在 GR00T N1.5 与 π0.5 两个策略上,于 LIBERO、LIBERO-Pro、RoboCasa365 三个仿真基准以及真实机器人操作任务中,一致优于固定时域基线与已有自适应方法。
- 仿真中最多提升 8.7 个百分点。
- 真实世界平均成功率从 53.3% 提升到 74.4%。
一致的结论比单个最高分更有价值:在两个公开策略、三个基准上都能稳定拿到收益,说明所依赖的几何信号并非某个特定模型架构的副产物。
局限性
摘要没有交代几何剖面如何映射为具体时域——阈值或判定规则是固定的还是需要按任务标定,直接影响复现难度。计算开销也未报告:要比较不同前缀的几何变化,就意味着在单次生成内部要考察多个前缀,这部分额外计算与它省下的执行时间相比是否划算,读者无法从摘要判断。实验只覆盖两个 VLA 主干,换到别的生成式策略架构(例如非流匹配的扩散策略或自回归式策略)是否仍然成立,摘要未给出证据。真实实验的任务数量、任务类型与失败模式都没有报告,53.3% 到 74.4% 这 21 个百分点具体来自哪类任务也无从判断。此外,自适应时域在安全关键场合是否符合实时性要求,仍需单独验证。
行业影响
对做 VLA 落地的团队来说,动作时域是那种「不显眼但逃不掉」的工程参数:它同时影响运动平滑度、闭环响应速度、推理频率与整机节拍,往往要在真机上反复试。GeoAAC 把这件事从离线扫参变成运行中的自适应决策,而且不必重新训练——这意味着已有的 VLA 部署可以在不改模型的前提下直接受益,风险与验证成本都很低。更重要的是它给出的方法论:生成式策略的中间过程(去噪轨迹)本身就是一份免费的诊断信号,可以用来做推理时的自适应控制。沿着这条思路,同一类几何信号还能用在提前终止、重新采样、置信度门控等环节上,对追求高节拍、高可靠性的操作与类人形平台尤其有吸引力。