跳到主要内容
返回时间线
arXiv来源发表:

SaveRouter 只用约三分之一监督反馈就把 LLM 路由的盈亏平衡点最多提前约 9.5 倍

核心概要

该工作提出 SaveRouter 稀疏监督路由框架,通过自适应选取信息量大的查询—模型反馈并跨相关查询共享能力信息,在四个路由基准上仅用约 33–41% 的可用训练反馈即保持有竞争力或更好的路由质量,并把盈亏平衡部署量相对最快的传统全监督路由降低约 1.9–9.5 倍。

AI-generated editorial illustration: Routing Should Pay for Itself: Sparse Supervision for Economical LLM Routing

深度剖析

论文把路由的前置监督开销纳入评估,提出 SA-BEP(需要多少部署查询才能用服务期节省回收前置监督支出)与 SA-CR(在固定部署规模上摊销该支出后的成本比)两个指标。 以往路由工作主要评估部署后的质量—成本权衡,默认路由器已经建好;这里把“学习路由本身要花多少钱”显式计入经济账。 指标定义在正文第 3 节与附录 A.2 给出,并在四个基准上以同一套成本记账协议报告;成本字段为各基准自带,作者说明绝对金额不可跨基准比较。

SaveRouter 用自适应稀疏反馈采集加分层能力估计来学习路由:按查询分组、以能力与不确定性共同打分选取查询—模型对,再用结构化组—模型先验、局部证据收缩和查询级残差修正估计未观测的模型质量。 相对均匀采样或仅按能力/仅按不确定性采集,论文把“采集哪些反馈”和“如何从稀疏反馈估计能力”作为耦合问题处理,并保留查询级细化。 消融显示去掉查询级残差修正使峰值分下降 1.63 个百分点、CR 从 0.2320 升到 0.3484;把任务分组换成嵌入聚类或合并为单一全局组都会降低质量与成本效率。

在四个路由基准上,主设置只用约 33–41% 的可用训练反馈,却取得最高峰值分与最低目标质量成本比,并把盈亏平衡部署量相对最快的传统全监督路由降低约 1.9–9.5 倍。 论文给出的不是单纯的服务期效率提升,而是把前置监督支出摊销后仍然更早回本,例如 LLMRouterBench 上 5.3K 对 11.5K、RouterBench 上 42.6K 对 326.4K。 结果来自 LLMRouterBench、Mixinstruct、MMR-Bench、RouterBench 四个基准,统一 20%/80% 训练/测试划分与随机种子 42,并在 ORBIT 工具链内与十个基线比较;WISERouter、BaRP、SemiRouter 为论文复现实现。

监督并非越多越经济:使服务成本最低的监督水平不一定是最早回本的水平,路由质量往往在收集完全部反馈之前就已饱和。 这把“密集监督可能被过度配置”从直觉变成可量化的权衡,并给出附加监督在何种条件下才值得其采集成本的命题。 正文报告 EmbedLLM 与 kNN 分别只用 30% 和 60% 监督即达到全监督准确率的 99%;消融中随机采集反而更早回本(3.8K 对 5.3K),但峰值分更低、SA-CR@1M 更高;MMR-Bench 与 RouterBench 上最低 CR 与最早 SA-BEP 出现在不同监督预算。

启示与展望

该结果适用于需要在部署前用历史查询采集查询—模型质量反馈的监督式路由场景,尤其是训练工作量或候选模型池较大、前置评估成本可观的情形。论文的评估只计入获取路由监督的模型执行成本与部署后的模型服务成本,不含完整的系统级成本,且各基准的成本字段与归一化不同,绝对金额不可跨基准比较或聚合。方法默认训练侧可获得查询分组信息或冻结的查询表示,并假设可以按查询—模型对选择性地获取反馈;附录 F 的模型池扩张研究的是重新训练的稀疏接入,而非零样本或保持参数的在线接纳。对希望据此决策的读者,论文提供了按目标质量、部署规模与监督预算共同权衡的框架,而不是一个固定的最优监督比例。

监督预算与路由质量之间并非严格单调,论文明确不把小的波动解释为额外监督本身有害,而将其归因于估计器所用观测变化导致的学习路由前沿改变,因此单个操作点的差异需要谨慎解读。SA-BEP 与 SA-CR 只在同一基准内可比,跨基准的绝对成本不可比较。BaRP 的摊销成本对重复交互是否计费敏感:在缓存反馈记账下其 SA-BEP 相对新鲜反馈记账下降约一个数量级,说明结论依赖反馈获取的计费假设。Mixinstruct 上多数方法质量已接近饱和,方法间差异主要体现在监督支出上;MMR-Bench 的最后一档只覆盖约 92.64% 的可用训练对,不应视为全监督。此外,WISERouter、BaRP、SemiRouter 为论文复现实现而非作者原始代码,InferenceDynamics 的适配使用记录的任务名构造任务画像,与 SaveRouter 从输入预测分组存在信息侧差异。这些都属于范围与解读上的开放问题,而非对工作的否定。

来源