跳到主要内容
返回时间线
arXiv来源发表:

DMM 让智能体先协商再行动:在 1600 个 MovingAI 任务中解出 1598 个,并扩展到百万级智能体

核心概要

该工作指出分散式多智能体路径规划中即使每个智能体的动作分布学得正确,独立采样仍会把各自合法的选择拼成冲突的联合动作,并提出 DMM——让智能体在通信轮次中迭代精炼离散的“动作意图”后再统一承诺,配合无评论家的多智能体强化学习微调方法 MICPO;在 POGEMA 上 DMM 通常取得更高成功率与更低解代价,在 MovingAI 的 1600 个任务中解出 1598 个(评估方法中覆盖最高),并可扩展到超过一百万个同时行动的智能体。

AI-generated editorial illustration: Decentralized Master-Mind: Joint Action Refinement through Iterative Intent Denoising in Multi-Agent Pathfinding

深度剖析

论文识别出学习式分散式 MAPF 策略的一个结构性限制:即便有通信,每个智能体仍在通信结束后独立采样自己的最终动作,当同一情境下存在多个合法的联合动作时,独立采样会把各自合理的局部选择重组为碰撞或死锁。 此前工作(PRIMAL、MAPF-GPT、DHC、DCC、MAGAT/MAGAT+、HMAGAT、SCRIMP、LC-MAPF 等)通过强化学习、模仿学习与学习式通信丰富每个智能体决策所依赖的信息,但最终动作仍是一次性独立采样;该工作把这一失败归因于采样机制本身,并用条件总相关给出“分散式分解差距”的命题,说明这是不可约误差而非学习不充分。 论文给出命题与附录 A 的证明,并在一个最小走廊场景中做受控实验:两条专家轨迹共享一个两种解法都可行的状态,DMM 把 94.8% 的采样放在两个有效联合动作上,而 LC-MAPF、MAGAT+、HMAGAT 约为 50%,即接近独立采样的结果。

DMM 把联合动作选择改写为跨通信轮次的离散意图迭代精炼:智能体从无信息先验采样初始意图,每轮广播当前意图与学习到的消息特征,采样一个离散投票并更新意图,最后各自按最终意图承诺动作。 与扩散/流匹配式精炼不同,DMM 把中间意图本身作为通信内容,使邻居的随机选择在承诺前就能相互影响;与集中式精炼(如 DiffLNS 集中精炼全体智能体的联合动作张量)不同,DMM 保持分散式执行,每个智能体只依赖本地信息与邻居消息。 论文给出意图初始化、消息广播、投票与意图更新的完整公式,并实例化两个架构:DMM-3M(3,241,784 个可训练参数,沿用 LC-MAPF 的 Transformer 编码器–解码器骨干)与 DMM-0.8M(763,296 个参数);附录 G 与附录 H 的推理期消融显示,通信中“演化的意图”比单独的学习特征承载更多协调信息。

论文提出 MICPO,一种无评论家的组相对强化学习方法,用于在轨迹级结果上微调 DMM 的多轮精炼过程。 常规 actor-critic 在分散式 MAPF 中不匹配:集中式评论家要泛化组合爆炸的联合状态,分散式评论家只有部分信息;MICPO 去掉价值函数,构造共享同一步采样初始意图的匹配轨迹组,并按智能体、按精炼轮次分别计算重要性比率,同时用冻结的模仿预训练参考策略限制漂移。 论文给出团队回报(偏离目标时长与受阻动作的加权和)、组内归一化、有界回放与轮级裁剪目标的完整定义,并报告训练配置:两个变体均模仿预训练 1,000,000 次迭代,MICPO 微调 500 个外层迭代(96,000 次优化更新),DMM-3M 微调约 56.3 GPU 小时、DMM-0.8M 约 14.1 GPU 小时(各用四块 H100)。

在 POGEMA、MovingAI 与百万级规模实验中,DMM 通常取得更高成功率与更低解代价,并在评估方法中取得最高任务覆盖。 POGEMA 上 DMM-3M 与 LC-MAPF-3M 共享编码器–解码器架构、通信瓶颈与训练数据,仅最终动作产生方式不同,因此构成对迭代意图精炼的受控比较;MovingAI 上 DMM 以反应式方式运行、不构建搜索树也不回滚已执行决策,却超过搜索式、混合式与学习式基线。 POGEMA 最大团队规模处,DMM-MICPO-3M 在 Warehouse(192 个智能体)成功率 1.000、Cities-Tiles(256 个)0.922,而最高成功率基线 LC-MAPF-3M 为 0.938 与 0.805;MovingAI 的 1600 个任务中 DMM-MICPO-3M 解出 1598 个、DMM-MICPO-0.8M 解出 1593 个,高于 HMAGAT(1576)、LG-LaCAM(1569)、LaGAT(1543)与 MAPF-LNS2(1411);大规模实验中 DMM-MICPO-0.8M 解出全部 16 个实例,最多 1,048,576 个同时行动的智能体。

启示与展望

该结果面向带局部通信、部分可观测、需要无碰撞到达各自目标的分散式多智能体路径规划场景,适用于仓储车队、城市级自动驾驶运输与物流等大规模协同导航设定。对实践者而言,DMM 提供了一条在保持分散式执行的前提下改善联合动作协调的路径:意图精炼可在推理时增加轮次而无需重训,DMM-0.8M 以更低运行时间保留第二高覆盖度,DMM-MICPO-3M 以接近 MAPF-LNS2 的运行时间提供最佳覆盖与解质量;在 600 秒预算下,两个 DMM 配置的中位运行分别可留下超过 99.6% 与 98.6% 的预算供后续可选的解精炼。论文也指出 DMM 不把联合动作可行性作为硬约束,因此无碰撞执行在 MovingAI 与大规模实验中仍依赖 CS–PIBT 这类外部机制,把显式可行性约束纳入精炼过程被列为后续方向。

走廊实验与 POGEMA 上的结论来自特定基准与训练配置,MovingAI 上搜索式与混合式方法受 600 秒墙钟限制、反应式策略受 5000 环境步限制,因此运行时间反映的是各自求解器配置而非等量算力预算;论文也说明解码与 RSE 的对比描述的是完整推理配置,而非 argmax 的单因素因果效应。大规模实验中屏蔽仍是主要运行时间成本,高密度下智能体可能形成一个大冲突组而限制并行度。此外,本证据包中的大规模性能表(表 1)在正文中呈现为空白单元格,因此该表的具体数值无法在此总结,只能依据正文叙述的定性趋势;若需要精确的步时、内存与总运行时间数字,应查阅原文表格。

来源