arXiv 2026年10月7日该工作系统研究了智能体后训练与MoE专家选择的关系,发现现成MoE模型的路由已按操作语义(如READ、UPDATE)形成专门化结构,而标准RL会破坏这一结构;作者提出分层路由控制框架,在轮次级用互信息对齐专家选择与操作标签、在token级用带阈值的相邻一致性正则,并加入熵门控以稳定训练,在AppWorld与AutomationBench上使PPO、GRPO、LOOP、GiGPO的成功率提升超过10点,同时提升推理效率。该工作系统研究了智能体后训练与MoE专家选择的关系,发现现成MoE模型的路由已按操作语义(如READ、UPDATE)形成专门化结构,而标准RL会破坏这一结构;作者提出分层路由控制框架,在轮次级用互信息对齐专家选择与操作标签、在token级用带阈值的相邻一致性正则,并加入熵门控以稳定训练,在AppWorld与AutomationBench上使PPO、GRPO、LOOP、GiGPO的成功率提升超过10点,同时提升推理效率。分层路由控制让MoE智能体RL在AppWorld与AutomationBench成功率提升逾10点该工作系统研究了智能体后训练与MoE专家选择的关系,发现现成MoE模型的路由已按操作语义(如READ、UPDATE)形成专门化结构,而标准RL会破坏这一结构;作者提出分层路由控制框架,在轮次级用互信息对齐专家选择与操作标签、在token级用带阈值的相邻一致性正则,并加入熵门控以稳定训练,在AppWorld与AutomationBench上使PPO、GRPO、LOOP、GiGPO的成功率提升超过10点,同时提升推理效率。该工作系统研究了智能体后训练与MoE专家选择的关系,发现现成MoE模型的路由已按操作语义(如READ、UPDATE)形成专门化结构,而标准RL会破坏这一结构;作者提出分层路由控制框架,在轮次级用互信息对齐专家选择与操作标签、在token级用带阈值的相邻一致性正则,并加入熵门控以稳定训练,在AppWorld与AutomationBench上使PPO、GRPO、LOOP、GiGPO的成功率提升超过10点,同时提升推理效率。