分层路由控制让MoE智能体RL在AppWorld与AutomationBench成功率提升逾10点
相关研究与后续进展核心概要
该工作系统研究了智能体后训练与MoE专家选择的关系,发现现成MoE模型的路由已按操作语义(如READ、UPDATE)形成专门化结构,而标准RL会破坏这一结构;作者提出分层路由控制框架,在轮次级用互信息对齐专家选择与操作标签、在token级用带阈值的相邻一致性正则,并加入熵门控以稳定训练,在AppWorld与AutomationBench上使PPO、GRPO、LOOP、GiGPO的成功率提升超过10点,同时提升推理效率。
Figure 1 : Overview of MoE routing control for agentic trajectories. Top: In each turn of interaction with the environment, agents generate thinking and tool-use fields, then receive environment feedback . Our routing control framework aims to align expert selection with agentic operations (e.g., READ , CREATE , and UPDATE ) in each turn, assigning distinct expert groups to different operations and encouraging similar expert selections within each turn. Bottom: With Qwen3-30B-A3B on AppWorld, our routing control framework (when used with standard RL) unlocks the performance limits and raises the inference throughput, by improving expert specialization (larger with-cross gap of expert usage similarity in Appendix A.1 ) and consistency (higher Jaccard scores).
arXiv深度剖析
现成MoE模型的路由已呈现与智能体轨迹对齐的操作分组专门化:同一字段内相邻token更倾向复用专家,语义相似操作(如READ、UPDATE)的轮次之间专家分布更相似,而按工具名等其它标准分组则不明显。 此前工作多把MoE路由视为训练中需被稳定的噪声源,或按模态、阶段等信号做专门化;该工作首次把智能体轨迹的“操作”语义作为路由结构的观测与优化对象,并给出token级与轮次级两层统计证据。 基于对现成MoE模型默认路由统计的分析(Fig. 2、Fig. 8),用组内与跨组专家使用相似度差距、字段内Jaccard相似度等指标度量,并在Qwen3-30B-A3B与Qwen3.5-35B-A3B上观察到相似规律。
提出分层路由控制框架:轮次级最大化专家分布与操作标签之间的互信息以强化操作专门化,token级仅在相邻路由已相似时(带gap阈值)强化前一token的专家集以保持局部一致性,二者均通过向router logits注入辅助梯度实现,不改变前向计算与top-k路由规则。 相较直接惩罚专家切换(switch_reg)或强制字段共识(routing_reg、outlier_reg)等变体,该框架的选择性控制保留了语义与字段边界处必要的路由变化;相较仅做负载均衡的损失,它额外利用操作标签奖励依赖操作的专家使用。 在AppWorld上以GRPO为基线的消融显示:token级控制使字段内Jaccard相似度提升7.7%,轮次级控制使后期互信息提升23.5%,且操作标签优于随机标签与应用名标签(Table 6);outlier_reg变体在实验中崩溃,switch_reg与routing_reg均低于最终框架(Table 2)。
引入熵门控机制:仅当rollout批次平均策略熵落在目标区间内时才施加路由控制梯度,否则将其detach而保留标准RL更新,从而避免路由控制引发的训练崩溃。 此前MoE RL稳定性工作多针对单轮任务或通过重放rollout路由(R3)对齐训练与推理;该工作把策略熵作为多轮智能体场景下辅助路由梯度的开关,并给出无门控、宽松门控与目标门控的对比曲线。 训练曲线对比显示:无熵门控时策略熵尖峰、两个评测划分约在第100步崩溃至零;较宽松阈值把崩溃推迟到约第140步;采用目标阈值时训练保持稳定并保留两个划分上的任务表现(Fig. 4)。
端到端实验表明该框架在多个RL算法与两个基准上一致提升任务表现并改善推理效率:AppWorld上最高提升12.9点,AutomationBench上使LOOP提升11.34点;在100–200步阶段吞吐从224提升至316 tokens/GPU/s(+41.1%),wall time从224秒降至174秒(-22.3%)。 相较仅优化策略梯度的标准智能体RL,该工作把路由结构作为可优化的训练信号,从而在相同模型、奖励与RL超参下同时改善成功率与推理效率,且与PPO、GRPO、LOOP、GiGPO兼容。 在90个AppWorld任务与480个AutomationBench公开训练任务上训练,使用Qwen3-30B-A3B-2507与Qwen3.5-35B-A3B,报告TGC/SGC与吞吐、wall time等指标;PPO在AppWorld上提升不一致,作者归因于单prompt轨迹数少导致互信息估计不稳定。
启示与展望
该框架面向使用标准top-k路由的稀疏MoE模型在解码阶段的多轮智能体RL后训练,适用于具备可解析工具调用、能据此定义操作标签的环境(如AppWorld的Python API调用与AutomationBench的结构化工具调用)。方法不修改MoE架构,可与PPO、GRPO、LOOP、GiGPO等策略梯度算法组合,因此对已有MoE智能体训练管线可直接作为辅助损失接入。效率收益的机制分析指向批大小大于1的批量解码场景,此时更集中的专家使用可提升专家权重复用与分组专家计算效率。
操作标签由任务相关的硬编码规则生成,换到新的工具生态时标签体系如何设计、规则误差如何影响路由控制效果,仍是开放问题。熵门控的阈值区间与token级gap阈值在文中通过搜索确定,其在不同模型规模、不同RL算法与不同任务分布下的稳健区间有待进一步刻画。效率提升的机制分析使用了降低router权重矩阵秩的合成诊断,而非质量保持的推理配置,因此批量解码下的收益边界仍需在真实部署中验证。此外,PPO在AppWorld上的提升不一致,作者将其归因于单prompt轨迹数少导致互信息估计不稳定,这一解释提示互信息信号对批次内轮次数量的依赖值得进一步研究。
