ACLArena 用四阶段后训练流水线量化智能体灾难性遗忘,并提出 LoRA 专家混合把 AIME26 从 10.21 拉回接近独立专家水平
核心概要
该工作构建了 ACLArena——一条数学、搜索、电商、指令遵循四阶段顺序后训练流水线,从模型层与 token 层诊断能力遗忘与迁移,系统比较多教师在线策略蒸馏(MMOPD)、自蒸馏微调(SDFT)与模型合并三种整合范式,并提出混合低秩专家(MLE):先用 SDFT 把多域轨迹整合进共享骨干,再为每个阶段冻结骨干、训练一个经 RL 优化的 LoRA 专家并按环境上下文路由,在四个推理与智能体任务上同时改善域内与域外表现。
深度剖析
顺序后训练的能力演化是非单调且高度依赖任务的:早期阶段存在正向迁移,中间阶段出现严重干扰,最后阶段只能部分恢复。 此前工业级智能体训练报告很少在受控条件下比较替代方案,该工作用固定课程(数学→搜索→电商→指令遵循)把遗忘与迁移现象显式量化。 表 1 报告 Seq-Math 把 NQ 从 13.3 提升到 22.0,Seq-E-commerce 把 AIME 从 23.33 降到 6.04、NQ 从 45.2 降到 14.6、多跳搜索从 37.4 降到 9.4,Seq-IF 再把 NQ 恢复到 33.5、多跳恢复到 25.0,同时 IF-Eval 达 84.8;最终检查点在 AIME26、NQ、-Retail 上均低于课程中曾达到的峰值。
遗忘的机制来自任务特定的优化方向只部分对齐,以及 token 层面的改写高度集中在高熵位置。 作者从模型层(参数位移的 PCA 投影、任务向量余弦相似度)与 token 层(固定前缀下 top-1 预测一致性按熵分箱)两个互补视角定位干扰来源,而非只报告性能曲线。 四个单任务 oracle 在 PCA 投影中方向明显不同;去掉共享前缀后各域自身 RL 增量近似正交;token 层分析显示低熵位置在后续所有阶段几乎不变,而预测变化几乎全部集中在高熵少数位置,且一致性随熵升高、随训练顺序单调下降。
三种整合范式各有取舍,没有一种能在所有域上一致改善共享检查点。 作者在统一框架下把 OPD、SDFT、模型合并归为行为空间在线、行为空间离线、参数空间三条复用路径,并把每条调到各自最佳配置而非稻草人实现。 MMOPD 把 AIME26 从 10.21 提到 21.25、NQ 从 33.5 提到 45.2、单跳从 44.9 提到 53.7、多跳从 25.0 提到 32.8,但 MMLU 与 IF-Bench 略降;SDFT 把 NQ 提到 48.3、单跳 55.6、多跳 38.0,却把 -Telecom 从 45.9 降到 21.7、IF-Eval 从 84.8 降到 53.6;模型合并取得最高 MMLU 80.3,但在多数电商与 IF 基准上更差。
MLE 把可迁移能力放进共享骨干、把互相干扰的阶段残差放进参数隔离的 LoRA 专家,从而在域内接近独立专家并在域外取得多项最高分。 该配方由前述诊断直接推出:SDFT 快速把异构轨迹整合成共享能力质心,RL 更新幅度远小于 SFT 因而适合表示为轻量残差,参数隔离则避免后续阶段覆盖已获得的专长。 MLE 在全部域内基准上接近独立训练的任务专家,并在 GPQA、单跳搜索、多跳搜索与 mock 域上取得所评估方法中的最高分;推理时按智能体执行上下文中可观测的交互环境路由,不需要基准身份或真实任务标签。
启示与展望
该框架面向需要顺序获得多种能力的通用智能体后训练场景,适用于环境上下文(系统指令与可用工具 schema)在部署时可观测、而基准身份与真实任务标签不可得的情形。对实践者而言,它提供了一套可复用的诊断流程:先用顺序训练作为显微镜观察遗忘与迁移,再在行为空间或参数空间选择整合路径;MLE 的适用前提是各阶段残差可以用低秩适配器表示,且路由信号来自执行环境本身。对研究者而言,ACLArena 可作为比较新整合策略的受控测试台,其四阶段课程、统一工具调用格式与可验证奖励设计使不同方法之间的差异更容易归因。
实验主要基于 Qwen3-8B-Base 与一条固定四阶段课程,观察到的遗忘模式与方法取舍在其它模型家族、更长训练序列与不同课程顺序下是否重现,仍是开放问题。MLE 依赖可观测的环境上下文选择专家,当该上下文模糊、在交互过程中变化,或需要在单次会话内组合多种专长时,其有效性尚未检验;作者提出的后续方向包括学习式路由、动态专家组合与适配器合并,并建议联合评估能力保留、迁移、显存占用与推理延迟。此外,本次读取的正文中部分结果表格的数值以空白形式呈现,主结果的具体数字主要来自正文叙述,读者若需逐项核对仍应查阅原文表格与附录。
