跳到主要内容
返回时间线
arXiv来源发表:

CPR 用 token 级路由在基座模型与 SFT 专家之间切换,域性能超 SFT 专家 1.4-5.5% 且通用能力下降从 3.4-14.5% 收窄至最多 0.5%

核心概要

该工作提出 CPR(Critical-Point Routing),一种在基座模型与其 SFT 专家衍生模型之间进行 token 级路由的框架,依据基座模型失败而专家成功的“关键 token”训练轻量分层路由器估计逐 token 调用专家的概率,并配合动量平滑与阈值门控的推理流程;在多种模型-领域配置下,CPR 在域性能上超过 SFT 专家 1.4-5.5%,同时把通用能力下降从 3.4-14.5% 恢复到最多 0.5%,且仅对约三分之一 token 调用专家,开销很小。

Source-provided article image: CPR for LLMs: Critical-Point Routing against Catastrophic Forgetting in Domain Adaptation
Figure 1 ·

Figure 1: Comparison of paradigms against catastrophic forgetting in SFT. (A) Existing methods compress both capabilities into one model, yielding a trade-off. (B) CPR (Ours) decouples them by routing the expert only on critical tokens, preserving both.

arXiv

深度剖析

提出在模型层面解耦通用能力与领域能力的思路:保留原始基座模型承担通用能力,仅在需要领域知识时选择性调用 SFT 专家,从而跳出既有方法所处的领域-通用权衡。 既有方法通常通过修改 SFT 损失来缓解遗忘,因而不可避免地在领域-通用权衡曲线上移动;CPR 改为在模型层面解耦两种能力,不再沿该权衡取舍。 摘要明确表述“step outside this trade-off by decoupling the two capabilities at the model level”,并说明保留基座模型、按需调用专家。

提出 CPR 框架:以基座模型失败但专家成功的“关键 token”为依据,在基座模型与其专家衍生模型之间做 token 级路由。 路由粒度落在 token 级,并以“关键 token”这一失败/成功对比作为路由依据,而非在整句或整模型层面切换。 摘要给出“token-level routing framework between a base model and its expert derivative, based on critical tokens where the base model fails but the expert succeeds”。

训练一个轻量分层路由器估计逐 token 的专家调用概率,并配套动量平滑与阈值门控的推理流程。 将路由实现为轻量分层概率估计器,并用动量平滑加阈值门控的推理程序来稳定调用决策。 摘要描述“lightweight hierarchical router that estimates the expert-call probability per token”以及“momentum smoothing and threshold gating”。

在多种模型-领域配置下取得全部设置的最优表现:域性能超过 SFT 专家 1.4-5.5%,通用能力下降从 3.4-14.5% 收窄到最多 0.5%,且仅约三分之一 token 调用专家。 相对 SFT 专家,同时提升域性能并大幅恢复通用能力损失,且以约三分之一 token 的专家调用量实现,开销很小。 摘要报告“state-of-the-art across all settings”“surpassing SFT expert by 1.4-5.5% in domain performance”“recovering its general-capability drop from 3.4-14.5% to at most 0.5%”“invoking the expert on only one-third of tokens”。

启示与展望

该工作面向需要领域适配又需保留通用能力的 LLM 部署场景:使用者保留原始基座模型处理通用请求,仅在领域知识必要时调用 SFT 专家。其设计目标是让领域性能与通用能力不再沿单一权衡曲线取舍,并以约三分之一 token 的专家调用量控制开销。适用对象是拥有基座模型及其 SFT 专家衍生模型、并可在推理时同时持有两者的工程与研究团队。

摘要未说明关键 token 的具体判定标准、分层路由器的结构与训练数据来源,也未给出动量平滑与阈值门控的参数设定;跨模型-领域配置的具体数量与名称、域性能与通用能力的评测基准与指标同样未在摘要中列出。这些属于需要阅读正文确认的开放问题,而非对工作的否定。

来源