跳到主要内容
返回时间线
arXiv来源发表:

DM³-Nav:去中心化多智能体多模态多目标语义导航

核心概要

本文提出 DM³-Nav,一个完全去中心化的多智能体语义导航系统,支持类别、语言和图像三种模态的目标指定以及单回合多目标搜索,机器人之间仅通过临时成对通信交换局部地图、目标状态和导航意图,无需中心协调器或共享全局地图;在 HM3DSem 场景(HM3Dv0.2 与 GOAT-Bench)上的评测显示其成功率匹配或超过集中式与共享地图基线,并在两台移动机器人的真实办公室环境中成功定位全部 8 个多模态目标。

Source-provided article image: DM$^3$-Nav: Decentralized Multi-Agent Multimodal Multi-Object Semantic Navigation
Fig. 1 ·

Fig. 1 : Overview of a multi-agent multimodal semantic navigation episode. Two robots (red and green paths) explore an unseen environment to successfully locate four distinct targets: (A) towel [language], (B) table [image], (C) handbag [language], (D) cabinet [category].

arXiv

深度剖析

提出完全去中心化的多智能体语义导航架构,取消集中式规划与共享全局地图,同时支持多模态目标与多目标回合。 此前多智能体方法(如 Co-NavGPT 依赖集中式 VLM 规划器与共享地图,MCoCo-Nav 虽去中心化推理但仍依赖全局聚合语义地图)只支持单一类别目标;单智能体方法(如 GOAT)虽支持多模态多目标但仅限单机。本文首次将多模态、多目标与完全去中心化三者结合。 在 HM3Dv0.2 上两机器人配置下取得最高成功率 74.6%(对比 Co-NavGPT 66.1%、MCoCo-Nav 71.6%),并在真实办公室环境中由两台 AgileX Scout Mini 完成 8 个多模态目标定位,全部依赖机载感知与计算。

提出 Multi-object Multi-agent SPL(MSPL)指标,将 SPL 扩展到多机器人、多目标、每目标多个有效实例的场景,以最优 makespan 为基准衡量效率。 原 SPL 仅适用于单智能体单目标回合,无法处理“椅子”等目标可由多个实例满足的情形;MSPL 基于广义旅行商问题(GTSP)的多智能体 min-max 扩展,在 n=1、m=1 时退化为标准 SPL,是严格泛化。 最优 makespan 通过混合整数线性规划(MILP)用 Gurobi 求解,且因仅依赖场景几何与目标位置可离线计算一次,不影响运行时性能。

通过意图广播与距离加权前沿选择的隐式任务分配机制,在无显式协商的情况下减少冗余探索。 拍卖式分配、分布式匈牙利法等传统方法需要协调轮次、连通通信或同步位置信息,在间歇性临时连接下不成立;本文的距离比值启发式仅用最近收到的邻居位置即可独立评估前沿。 消融实验显示通信使成功率从 68.6% 提升至 74.6%,SPL 从 28.9 提升至 38.2;四机器人团队相比单机器人成功率相对提升 40%(34.5% vs 24.6%),且回合完成更快。

识别并改进 GOAT 导航管线中的多项局限,即使在单智能体情形下也带来显著性能提升。 改进包括:用对数几率累积替代逐元素最大值更新地图、基于射线投射的探索区域标记、三步目标区域选择、局部规划优化、YOLO 二次检测验证等。 在 GOAT-Bench 多目标回合上,预测语义下 SR 从 26.3% 提升至 44.0%、SPL 从 17.5 提升至 30.7;真值语义下 SR 从 56.7% 提升至 85.7%、SPL 从 40.3 提升至 61.6%。

启示与展望

该工作面向未知室内环境中的多机器人多目标语义导航,适用于机器人间可进行间歇性临时成对通信、且各机器人具备机载感知与计算能力的场景。系统设计为模块化,地图对齐阶段(ORB/RANSAC)和前沿选择策略均可替换。真实世界验证在约 200 平方米办公室环境中由两台 AgileX Scout Mini 完成,定位 8 个多模态目标耗时 14 分钟。未来工作方向包括面向边缘部署的轻量化感知模型、异构机器人团队(如 UAV 与 UGV 组合)以及通过时序逻辑支持更复杂的任务规范。

MSPL 随机器人数量增加而下降(四机器人 0.35 vs 单机器人 0.42),作者将其归因于最优基线假设完美任务分配、团队规模增大时更难近似,但这一解释的定量边界尚待进一步刻画。真实世界实验仅涉及两台机器人和约 200 平方米的单一办公室环境,更大团队、更复杂环境下的通信可靠性、地图对齐成功率与协调开销仍需观察。此外,附录 A 中各项改进对整体性能的单独贡献未逐一量化,读者若关注某一具体模块的影响,可能需要参考代码或后续工作。

来源