跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

arXiv

分层路由控制让MoE智能体RL在AppWorld与AutomationBench成功率提升逾10点

该工作系统研究了智能体后训练与MoE专家选择的关系,发现现成MoE模型的路由已按操作语义(如READ、UPDATE)形成专门化结构,而标准RL会破坏这一结构;作者提出分层路由控制框架,在轮次级用互信息对齐专家选择与操作标签、在token级用带阈值的相邻一致性正则,并加入熵门控以稳定训练,在AppWorld与AutomationBench上使PPO、GRPO、LOOP、GiGPO的成功率提升超过10点,同时提升推理效率。