CERA-MoA:路由机制与持续学习智能体协同演化的混合智能体框架
核心概要
该工作提出 CERA-MoA,一个迭代式强化学习框架,让动态路由器与多个独立智能体策略协同演化:路由器用基于中间层隐状态的预测式熟悉度估计器在生成前评估各智能体对查询的语义胜任度,并以累积阈值自适应路由激活最小智能体子集,同时依据智能体不断变化的能力主动分配针对性训练样本,从而在多个领域上优于静态智能体路由与固定工作流微调基线。
Figure 1: Overview of CERA-MoA.
arXiv深度剖析
提出样本级混合智能体框架,使路由与智能体持续强化学习在同一闭环中协同演化。 以往编排优化假设候选模型能力固定,而智能体微调又依赖人工划分或均匀数据集,二者相互脱节;该工作把迭代路由直接嵌入训练循环,依据智能体演化中的胜任度主动分配语义查询。 论文以框架形式给出训练与推理两阶段的闭环设计,并在多领域实验中报告优于静态智能体路由与固定工作流微调基线。
设计预测式熟悉度估计器,用中间层隐状态在生成前评估智能体与查询的语义匹配度。 不同于依赖外部评估器或完整 rollout 生成的做法,该方法拼接第 ⌊L/2⌋ 与 ⌊3L/4⌋ 层隐状态,经可训练预测头与冻结目标头投影后以归一化欧氏距离和指数衰减得到熟悉度分数,避免完整生成的额外开销。 论文给出估计器的具体构造与公式,并说明冻结目标头仅提供稳定参考点、不编码语义原型或能力标签。
提出累积阈值自适应路由,按需激活最小智能体子集以平衡性能与计算成本。 不再使用固定 top-k 分配,而是按探索增强路由分数排序、以原始熟悉度分数累计达到阈值 τ 为激活条件,若全体累计仍低于阈值则回退激活全部智能体。 论文给出排序分数与激活判据的公式,并说明训练时加入探索奖励与历史熵、推理时将其置零。
通过能力感知的样本分配促进智能体能力分化,使其从同质通才走向领域专才。 智能体在特定语义空间成功解题会获得更高熟悉度,从而更可能在未来被分配到语义相近的查询,形成自然诱导领域专精的学习循环。 论文采用零样本、无角色提示的设计,并称经验分析中的能力分化由熟悉度路由与闭环强化学习驱动,而非人工角色偏置。
启示与展望
该框架面向需要多智能体协作的复杂推理任务,适用于共享骨干(N=4)与异构骨干(N=3)两类设置,训练采用零样本、无角色提示,输入上限 800 token、生成上限 1000 token,并禁用模型内置推理模式。它使研究者可以在训练循环中同时优化路由与智能体策略,并让路由在推理时按熟悉度阈值激活最小子集;对确定性任务采用熟悉度加权多数投票,对开放式任务直接输出最熟悉智能体的回答。
所加载文本未包含具体实验结果表格与数值,因此各领域上的性能提升幅度、能力分化的定量证据以及效率收益的具体大小仍需查阅原文图表确认;此外,熟悉度估计器依赖冻结骨干的中间层特征,其在骨干更换或领域大幅偏移时的稳定性、以及阈值 τ 与分离边界 m 的敏感性,都是值得进一步观察的开放问题。
