跳到主要内容
返回时间线
arXiv来源发表:

RouteFM 用一次预训练把 LLM 路由变成可复用能力,在未见过的多模态基准 MMR-Bench 上以每个候选仅八条观测领先最强基线 2.23 质量分

核心概要

该工作提出 RouteFM,把大语言模型路由从针对单一查询分布与候选池的“局部拟合”改写为“预训练一次、随处路由”的基础模型范式:通过跨异构路由环境的片段式预训练学习一种可复用的、以目标查询为条件的候选比较能力,候选模型仅以匿名行为证据(历史查询嵌入、观测质量、归一化相对成本)表示,不暴露模型名称或身份嵌入;推理时路由器保持冻结,仅靠上下文即可适配新领域、新模态、新候选池与更小的上下文预算,在排除于预训练之外的 MMR-Bench 上以每个候选八条观测超过最强非 RouteFM 基线 2.23 质量分。

AI-generated editorial illustration: Pretrain Once, Route Anywhere: Towards a Foundation Model for LLM Routing

深度剖析

论文把 LLM 路由重新表述为“基础模型”问题:不再为每个环境拟合一个路由器,而是学习一个跨环境共享的路由函数,环境差异通过条件化(当前查询分布与候选池的行为证据)来体现。 既有路由器多遵循作者所称的“局部拟合”范式,其监督信号来自特定查询负载与候选池,环境变化时往往需要重新采集行为观测并重新优化;RouteFM 则把路由视为可迁移能力,用片段式预训练覆盖不同任务、候选池组成、候选顺序与上下文规模。 论文给出问题形式化(局部拟合映射与共享路由函数的对比)以及跨环境片段式预训练的具体构造,包括候选顺序随机置换、上下文与目标查询 ID 不相交、以及自然/机会/边界三类目标片段采样。

RouteFM 的机制核心是匿名候选的上下文能力刻画与目标条件化比较:行为观测被编码为观测 token,再压缩为固定数量的潜在能力 token 作为能力画像,目标查询通过并行的画像分支与原始上下文分支检索证据,并在候选维度上用 Transformer 编码器做池内比较。 与依赖固定模型身份或持久模型嵌入的做法不同,RouteFM 不接收模型名称、提供方、参数量或模型 ID 嵌入,候选表示完全来自其行为历史;同时它保留压缩画像与未压缩观测序列两路互补表示,以保留压缩过程中可能丢失的细粒度证据。 消融显示移除候选池 Transformer 的退化最大,在有限观测下出现明显下降;移除目标到上下文的注意力也持续降低性能,尤其在观测有限时;把 Qwen3-VL 查询表示换成纯文本 BGE 编码器同样带来跨观测预算的性能下降。

冻结的 RouteFM 在域内路由与跨模态迁移上均取得最高路由质量,且优势集中在行为证据稀缺的低上下文区间。 跨模态评测使用被排除在预训练之外的 MMR-Bench,其查询特征与模态都与预训练所见不同,属于更强的分布偏移;在这种设定下,少量行为上下文即可让冻结路由器适配新候选行为,无需参数更新。 在 MMR-Bench 上,RouteFM 在全部观测预算下路由质量最高,优势在八条观测时最明显,超过最强非 RouteFM 基线 2.23 质量分;随着行为证据增多,差距总体收窄,在大观测区间仅剩较小差距。域内 RouterEval 上同样在各观测预算下取得最高质量,且同一冻结模型在整个上下文范围内保持竞争力。

部署变化可通过上下文而非重训练来应对:新模型加入、目标域切换与上下文预算压缩都能在冻结参数下处理。 论文用支持集受控协议比较了从零训练、预训练后微调与冻结 RouteFM:从零训练同一架构持续落后,而在目标域上微调预训练模型只带来小幅变化(部分预算略有提升、部分略低),说明可迁移的路由能力主要在预训练阶段获得。 新模型纳入实验中,RouteFM 在仅观测新候选八条示例后即超过所有重新拟合的基线,十六条观测时扩展池的路由质量超过原候选池;上下文预算实验中,RouteFM 仅用部分可用观测即可追平 Weighted NN、MLP 与 EmbedLLM 的全上下文性能,且随参考方法更强所需比例上升。

启示与展望

该结果面向需要在异构且不断变化的候选模型池之间做质量—成本权衡的部署方,尤其是行为证据稀缺、候选池频繁增删、或需要跨模态路由的场景。适用设定是:候选模型以匿名行为证据(历史查询嵌入、观测质量、归一化相对成本)描述,路由器在预训练后保持冻结,部署偏好通过路由目标中的质量—成本系数调节。论文报告的能力来自四个预训练数据源(LLMRouterBench、RouterBench、RouterEval、MixInstruct)构成的异构混合,预训练数据组成分析显示移除 LLMRouterBench 的退化最大,说明迁移能力与预训练环境的多样性和平衡度相关。成本被处理为片段内相对信号而非绝对金额或延迟,因此预测成本不宜跨片段比较。

读者仍需关注若干开放问题:其一,论文把成本作为片段内相对特征,未来若要把延迟、可用性、资源约束等系统级信号纳入统一决策接口,其行为尚待研究;其二,当前评测中的候选池规模与观测预算有明确范围,更大规模、更长期持续演化的路由生态下的表现属于作者提出的未来方向;其三,跨模态迁移的收益在观测充足时收窄,说明优势主要位于低上下文区间,高证据场景下的相对价值需要按部署条件判断;其四,本文所依据的文本为完整论文正文与附录,但表格中的部分数值以图形或占位形式呈现,个别具体分数无法从文本直接读出,因此对细节数字的引用应以原文表格为准。

来源