MoSDOT 用半离散最优传输对齐噪声与协调模式,使离线多智能体蒸馏学生保留教师的多模态支撑
核心概要
该工作指出标准流式教师在训练时独立配对噪声与回放目标,会让相邻噪声被路由到冲突的协调模式,从而在模式之间产生无效样本并经蒸馏损失传播给学生;为此提出 MoSDOT,将多模态回放归纳为带指定容量的有限模式支撑,并用条件半离散最优传输在教师训练前把每个噪声样本分配到单一模式,在受控诊断与离线 MARL 基准上改善了端点质量与路由一致性,并另设共享随机性变体以暴露严格乘积执行固有的残余差距。
Figure 1: Overview of source-to-mode routing. (Left) Standard Flow Policy: independent noise–target pairing can entangle nearby source samples with incompatible coordination modes, producing off-support fan mass. (Middle) MoSDOT: semi-discrete optimal transport partitions noise space into capacity-matched cells assigned to coordinated behavior modes. (Right) Route quality is measured by off-support avoidance ( fan-free endpoints ), consistency of source-to-mode routing ( clean route consistency ), endpoint accuracy to valid modes ( strict success ), and balanced mass across modes ( balanced coverage ). Full metric definitions are provided in Appendix E.6 .
arXiv深度剖析
论文识别出教师训练阶段的一个失败模式:标准流式教师独立配对噪声与回放目标,使相邻噪声样本被路由到相互冲突的协调模式,教师因此在有效模式之间产生样本。 以往工作主要关注蒸馏过程本身,而该工作把注意力上移到蒸馏开始之前教师分布的构造,指出教师侧的路由伪影是上游来源。 该结论由受控诊断支撑:在 landmark 诊断中,Flow matching 的 fan-free 为 0.857、route consistency 为 0.856,Drifting 的 route consistency 最低为 0.653 且 Jacobian 非对角比最大,说明其逐智能体输出强烈依赖其他智能体的噪声。
论文提出 MoSDOT,把多模态回放归纳为带指定容量的有限模式支撑,并用条件半离散最优传输把噪声空间划分为分配给单一模式的 Laguerre 单元,再训练教师。 相对独立配对,该方法以容量控制的源区域—模式耦合替代任意配对,容量取各模式的经验回放频率,且源分配在联合动作整体上进行而非逐智能体模式之积。 在 landmark 诊断中 MoSDOT 的 fan-free 为 0.983、route consistency 为 0.972、success 为 0.991、balance 为 0.961,四项均为最优或接近最优;其 Jacobian 非对角比与 flow matching 相当,明显低于 IMLE 与 Drifting。
论文表明教师侧改进能延续到去中心化蒸馏:在相同学生结构、种子列表、聚合规则与训练预算下,MoSDOT 蒸馏出的严格乘积学生保留了更高的 fan-free、success 与 balance,而 IMLE 与 Drifting 的学生在蒸馏中损失了大量端点质量。 这给出教师几何与学生几何之间的对应关系,说明改善集中式源分配可以提升去中心化执行者所保留的支撑。 学生侧诊断中 MoSDOT 为 fan-free 0.971、success 0.971、balance 0.963,而 IMLE 学生为 0.784/0.558/0.621、Drifting 学生为 0.364/0.685/0.328。
论文用共享随机性变体把严格乘积差距与教师侧分配误差分离开:在 XOR 目标上,即使 MoSDOT 教师把质量集中在两个有效元组,独立局部采样在蒸馏后仍混合两种模式,而共享模式选择信号后学生集中到有效元组。 该变体让智能体在不交换观测、动作或消息的前提下通过公共信号关联模式选择,从而把残余误差归因于独立局部采样而非教师分配失败。 附录给出解析结果:严格乘积学生在匹配边缘分布时仍会给不支持元组分配质量,而共享随机性策略作为乘积分布之混合可精确表示反相关 XOR 目标。
启示与展望
该结果面向在固定数据集上学习协调策略的离线 MARL 研究者与工程实践者,适用于回放中存在可辨识有限模式支撑、且智能体数量有限、动作空间为小规模离散或低维连续的情形。方法在教师训练前一次性完成对偶优化、Laguerre 分配、有限缓存重平衡与缓存存储,部署的仍是一步网络,因此推理开销不变。共享随机性变体适用于允许公共协调通道的部署场景,可在不交换观测、动作或消息的前提下让智能体就模式选择达成一致。
严格乘积约束本身是核心限制:独立局部采样无法表示任意相关的联合支撑,共享随机性变体只是暴露而非消除该差距,且需要公共协调通道,其可采纳性与所需共享维度仍待量化。经验范围限于三个离线 MARL 基准、至多若干智能体与较小离散或低维连续动作空间,向更大智能体规模、更丰富动作空间或在线微调的扩展尚未验证。此外,正文中的基准结果表在所提供的文本中为空,因此 SMACv1/v2 与 MPE 的具体奖励数值无法在此核对,只能依据正文对趋势的描述。
