跳到主要内容
返回时间线
arXiv来源发表:

SeLMRoute 用 16 个可解释语义探针把查询需求变成概率状态,在 LLMRouterBench 上取得 72.08% 平均准确率

核心概要

SeLMRoute 把 LLM 路由拆成三步——先用决策模型对查询做 16 个可解释语义判断并保留概率分布形成 40 维语义状态,再用轻量监督回归器预测各候选模型表现,最后套用部署目标;在 LLMRouterBench(15 个数据集、20 个候选模型、11,481 条查询)上平均准确率 72.08%±0.45,分组五折折外评估 72.64%,高于最强固定候选的 69.23%,并在 13 模型性能-成本设置中五个分组全部取得正向 PerfGain(均值 2.66%)。

AI-generated editorial illustration: SeLMRoute: Probabilistic Semantic Evidence for Large Language Model Routing

深度剖析

论文提出把「查询需要什么」显式化为可复用的概率语义状态:16 个探针(8 个二值 Noul、8 个四级 Score)覆盖数学推理、代码推理、形式逻辑、事实回忆、社会情感、工具交互、外部知识、时效信息,以及领域专业化、推理深度、约束密度、上下文整合、分解需求、歧义、精确性、答案开放性,原始概率质量构成 40 维表示。 既有路由器多直接从查询嵌入、模型表示、偏好数据或相似样本聚类学习决策,其路由表示很少说明查询实际需要什么;SeLMRoute 让每个坐标在训练性能学习器之前就有声明的语义含义,且不含候选模型身份。 探针表与维度推导在正文中给出;语义抽取对每条查询只做一次并在所有下游实验复用。

框架把语义证据抽取、候选性能学习与路由目标三层解耦,同一语义状态可服务不同候选池与不同部署目标。 性能学习器只接收语义状态而不直接读原文,模型身份不出现在语义状态中;新增模型需要经验性能映射,但已抽取的语义向量无需重算。 主实现用多输出 CatBoost 回归器联合预测候选池得分;性能-成本设置因候选-查询单元缺失改用候选专属回归器,语义表示与路由目标不变。

在 LLMRouterBench 性能导向设置上,概率质量表示取得所评估的语义、稠密、词法与领域级表示中最高的平均表现,并高于论文列出的已发表路由器数值。 40 维概率质量优于 88 维 Full 表示与 16 维 Hard 表示;GTE-Qwen2 嵌入、DomainOnly、TF-IDF 均未超过概率质量。 五个分组划分下概率质量平均准确率最高、Gain@B 最大、Gap@O 最小;与 Hard 的折外配对差异置信区间包含零,未达 5% 显著性;与已发表路由器的比较因分组协议不同仅作外部参照,不用于配对统计声明。

同一语义表示可支持性能-成本路由:在 13 个旗舰模型、10 个数据集、12,446 条查询的设置中,五个分组测试性能全部优于 GPT-5 参考,但严格货币节省未获确立。 路由参数在内部验证集上选定并固定后再评估测试集,避免用测试结果反选操作点;因此部分测试集上更便宜且更准的配置不计入严格 CostSave。 PerfGain 范围 +0.52% 至 +4.58%,均值 2.66%;五个分组均未取得正的严格 CostSave,两个满足验证精度要求的配置成本略高于 GPT-5。

启示与展望

该工作面向需要在多个候选 LLM 之间按查询分配请求的部署场景,尤其是希望路由依据可被人检查、且同一查询表示能跨候选池与跨部署目标复用的系统。它使语义证据抽取与性能学习分离,因此更换价格、质量偏好或候选可用性时无需重新定义语义证据;开放权重决策模型的替换实验也表明该接口不绑定特定后端。适用设定是已有历史候选-查询结果可供训练性能映射,且语义抽取的额外延迟可被接受。

概率质量相对硬判断的优势在折外配对比较中置信区间包含零,是否在更广基准上稳定仍待验证;十二探针压缩配置虽观测差异小,但未能在预设非劣性边界内确立非劣。域外泛化呈现两种情形:留出单个数据集时语义表示与稠密表示接近,留出整个任务域时稠密表示点估计领先,说明描述陌生查询并不替代候选模型在该任务区域的性能证据。语义熵在校准分布内能较好排序困难查询,但固定阈值迁移到未见域后未带来有意义的准确率提升。新候选模型加入时语义向量可复用,性能学习器仍需候选专属校准。语义抽取是主要延迟来源,其货币开销估计来自性能导向基准,与性能-成本基准的查询总体不同,两者不宜直接相加。

来源