PRIMAL3:借助 LaCAM3 的大规模多智能体强化与模仿学习路径规划

· Editorial Team estimated
多智能体路径规划 强化学习 仓储自动化 去中心化协同 大规模物流

PRIMAL3 是一个超大规模的学习式多智能体路径规划(MAPF)框架,融合了强化学习、拓扑感知通信、LaCAM3 引导训练与基于 PIBT 的动作精化。它专门针对瓶颈、死胡同、持续冲突等拓扑关键状态下的失败,可扩展至多达 10 万个智能体的城市级实例,显著优于现有最优的学习式基线,并已在真实机器人系统上完成验证。

原文 · arXiv:2608.04905

背景

多智能体路径规划(MAPF)是仓储自动化的核心协调问题:成百上千台机器人必须在实时约束下互不碰撞地抵达各自目标,而经典求解器在此规模下往往力不从心。学习式方法有望提供快速、去中心化的策略,但它们恰恰在最需要协调的地方表现退化——瓶颈、死胡同与持续冲突附近,一次错误决策就会级联成整体死锁。PRIMAL3 是 PRIMAL 系列学习式 MAPF 框架的第三代,明确围绕这些拓扑关键状态重新设计。

核心创新

PRIMAL3 整合了四个组成部分。其一,每个智能体用由割点、死胡同区域、最短路径距离与阻塞估计导出的特征来表示——这些拓扑感知特征让智能体知道地图在何处变得脆弱。其二,两张互补的交互图:同向跟随图沿兼容路径传播多跳上下文,反向冲突图则通过掩码注意力与相对特征区分争夺共享空间的智能体。其三,训练时用策略熵识别不确定的智能体,由经典搜索求解器 LaCAM3 在学到的策略拿不准的地方提供基于置信度触发的动作干预与标签平滑的模仿目标。其四,执行阶段由优先级感知的 PIBT 模块综合持久、学习式与距离感知优先级来精化联合动作,同时保证无碰撞。LaCAM3 仅在训练期使用,推理时完全不需要。

实验结果

PRIMAL3 显著优于现有最优的学习式 MAPF 基线,可扩展至包含多达 10 万个智能体的超大规模实例——这是城市级的问题规模。框架在物理机器人系统上完成验证,说明学习到的策略能部署到真实硬件而不仅是仿真;消融实验确认了从拓扑感知特征、LaCAM3 引导训练到 PIBT 精化各组件各自的贡献。

局限性

摘要只给出相对学习式基线的改进,未提供精确的成功率或完工时间数字,因此与经典 anytime 求解器的直接对比难以评估。真机实验虽然证明了可行性,但规模自然远小于 10 万智能体的仿真,仿真规模与物理部署之间的鸿沟仍是关键待解问题。框架由四个相互作用的组件加上训练期专家引导构成,复杂度较高,训练稳定性与超参数敏感性问题仅靠消融难以完全回答。

行业影响

仓储与物流运营方正在把 MAPF 推向经典规划器无法实时服务的规模。一个能处理 10 万智能体实例、推理时不依赖专家求解器、且被证明可迁移到实体机器人的学习式框架,直接对应车队管理产品的技术路线图。拓扑感知设计也有现实意义:真实仓库里遍布瓶颈与死胡同巷道,而这正是 PRIMAL3 瞄准的失败模式。对 AMR 厂商而言,这为超越当今数百台机器人规模限制的协调技术栈提供了一条可信路径。