动作分块为何能提升机器人控制中的行为克隆性能?
本文对动作分块(action chunking)为何能提升行为克隆性能进行了严谨剖析。仿真与真实世界实验推翻了主流假说(时间一致性、视界缩短、表征学习),指出真正收益来自更强的非马尔可夫表达能力、更低的误差累积,以及一个新识别的机制——隐式集成(implicit ensembling)。作者在完全不使用动作分块的情况下,通过将策略部署为随机延迟策略的集成,复现了分块策略的性能,并提出一种显式实例化集成的策略类,在多个领域显著超越动作分块。
原文 · arXiv:2608.02547背景
动作分块——一次预测并执行多个动作而非单个动作——已成为高效机器人控制策略的关键组件。然而,学界对其有效性的理解一直很有限,通常将其归因于时间一致性、视界缩短或表征学习等假说。缺乏机制层面的解释意味着,从业者只能把动作分块当作”恰好有效”的经验法则来使用。
核心创新
通过仿真与真实世界的严谨实验评估,作者证明现有假说均无法解释动作分块的成功。真正的收益来自相比马尔可夫策略更强的非马尔可夫表达能力与更低的误差累积——在许多值得关注的场景中,这些收益完全可以由延迟策略(delayed policy)复现:这种策略基于 k 步之前的观测来预测单个动作。此外,论文识别出另一项额外收益:隐式集成。通过学习多样化的时间关系(a_t 以 o_t 为条件、a_t 以 o_{t-1} 为条件,依此类推),动作分块策略的行为等同于一个模型集成,从而比只学习单一时间关系的策略更鲁棒、泛化性更强。
实验结果
在仿真与真实世界的机器人控制场景中,作者在完全不做动作分块的情况下复现了动作分块的性能——做法是将动作分块策略部署为带随机延迟的策略集成。基于这些洞见,他们提出一种显式实例化集成的策略类,并证明其在多个领域显著优于动作分块。
局限性
分块与延迟/集成策略之间的等价性在”许多值得关注的场景”中成立,而非普遍成立,因此仍存在分块自身结构起关键作用的场景。显式集成策略类是在多个领域而非所有领域超越动作分块;此外,分析聚焦于行为克隆范式,未覆盖强化学习等其他学习框架。
行业影响
动作分块已经嵌入大多数已部署的模仿学习技术栈,但通常没人能说清它为什么有效。本文为从业者提供了机制层面的解释,更重要的是给出了替代方案:将单动作策略部署为随机延迟策略的集成,即可在训练与执行上更简单的同时复现分块性能,显式集成变体还能更进一步。这对应着更低的推理成本、更易调试与更强的鲁棒性——为构建商用机器人控制策略的团队提供了具体的架构指引。