跳到主要内容
返回时间线
arXiv来源发表:

FlexRouter用行列式点过程挑选互补模型子集,在RouterEval上把平均Success@10提到0.8632与0.9914

核心概要

该工作把大模型路由重新表述为面向覆盖率的子集选择问题,用行列式点过程同时刻画模型能力与模型间冗余,并通过失败集边缘化的训练目标直接优化“至少一个被选模型答对”的概率,在RouterEval的中池(3811个候选模型)与大池(5000个候选模型)设置上取得更高的平均Success@10(0.8632与0.9914)和更高的子集多样性,同时用自适应贪心停止规则按查询难度决定子集大小。

AI-generated editorial illustration: FlexRouter: Learning Complementary Model Sets for Flexible LLM Routing

深度剖析

把路由目标从“逐个模型打分取top-k”改为“最大化至少一个被选模型答对的概率”,即答案覆盖率。 以往方法独立给模型打分再取top-k,忽略模型相关性,容易选出共享失败模式的冗余模型;该工作把路由形式化为面向覆盖率的子集选择问题,并指出这与“生成多个候选、再由验证器或用户挑选”的实际推理流程一致。 论文给出覆盖率奖励的定义(选中子集与正确集相交即为成功),并在RouterEval上以Success@k作为路由阶段覆盖率指标进行评测,作者明确说明该指标不等于最终部署准确率。

用行列式点过程(DPP)参数化路由策略,使子集概率同时包含模型质量与模型间冗余。 DPP的核矩阵由查询相关的质量分与模型嵌入余弦相似度构成,对角线表示单个模型能力,非对角项惩罚高度相关模型的联合选择,因此行列式天然偏好高质量且互补的子集。 论文给出核构造公式与正半定保证,并在消融中比较余弦核与RBF核:余弦核在两种设置下都带来更高多样性,成功率保持竞争力,故被选为默认核。

提出基于失败集边缘化的覆盖率训练目标,无需真实最优子集标签。 标准DPP最大似然需要观测到的目标子集,而这里只有每个查询-模型对的二元正确性标签,不存在唯一最优子集;作者改为最小化“子集完全落在失败集内”的概率的负对数,并加入逐模型正确性的二元交叉熵作为辅助监督。 论文给出失败集边缘概率的推导(附录命题3),并报告监督量消融:仅用25%训练查询时平均Success@10为0.860,与全量监督相差2.4个百分点。

推理阶段用边际对数行列式增益的贪心策略与自适应停止规则,按查询难度决定子集大小,无需预设预算。 top-k路由强制固定预算,而该方法的DPP对数行列式目标非单调,加入高度相关模型反而会降低子集得分,因此停止规则会在候选不再提供独特贡献时自然终止。 论文报告停止阈值下的覆盖率-成本权衡:阈值0.2时平均子集大小从10降到6.41,覆盖率仅下降1.13%;阈值0.5时子集大小降到1.41,覆盖率下降10.57%。

启示与展望

该工作定位于路由阶段的候选池构建,适用于“先并行生成多个候选、再由验证器、奖励模型、LLM-as-judge重排、自一致性聚合或人工挑选最终答案”的推理流程;作者明确说明Success@k是路由阶段的覆盖率指标,不是最终部署准确率。方法面向候选模型池较大且每个查询-模型对都有二元正确性标签的设定,训练用RoBERTa-base编码查询并投影到128维共享空间,推理用贪心MAP与自适应停止,最大子集大小为10。对希望按查询难度弹性分配算力的服务方,停止阈值提供了直接的覆盖率-成本调节旋钮。

论文自身指出若干开放问题:下游选择机制并不保证总能找回唯一正确答案,与具体选择器联合的端到端评测仍待开展;多样性用固定模型嵌入在模型层面度量,不等于每个查询的输出语义多样性,因为RouterEval只提供正确性标签而非全部生成回复;成本以调用模型数(平均子集大小)为代理,真实成本还取决于各模型延迟、token价格、输出长度、批处理与硬件;监督量消融只覆盖查询级标签稀疏,未覆盖模型级标签稀疏。此外,本次读取为全文,但表格中的部分数值以图像形式呈现,正文引用的具体数字以文字描述为准。

来源