跳到主要内容
返回时间线
arXiv来源发表:

Samsung Research 提出 Net Utility:按奇异方向分配 LoRA 合并秩预算,视觉任务平均提升 2.1%、语言任务提升 2.2%

核心概要

该工作指出 LoRA 合并中“每层、每任务平均分配秩预算”的均匀假设是合并模型与单任务 LoRA 性能差距的主要来源,并提出免数据的 Net Utility 指标:对每个任务 LoRA 做 SVD 分解,按“对自身任务的贡献减去对其他任务的干扰”给每个奇异方向打分,再在总秩预算约束下全局挑选得分最高的方向;在 7 个视觉任务与 6 个语言任务上叠加于五种合并方法与三种合并空间,视觉平均提升 2.1%、语言平均提升 2.2%。

AI-generated editorial illustration: Not All Ranks Are Equal: Budget-Aware LoRA Merging Across Tasks

深度剖析

论文把合并性能差距归因于秩分配方式而非合并算子本身,并给出证据:在七个视觉数据集上用 task arithmetic 合并时,放松均匀预算假设可带来约 +3.4% 的平均性能提升。 此前多数合并方法(如 TSV-Merging、PRIME、Core Space)把保留秩设为跨层共享的固定常数,部分方法还要求任务间均分;该工作把“秩预算如何分配”单独提为研究对象。 基于七个视觉数据集与 task arithmetic 的对照观察,属于论文自报的实验结果,未在加载文本中给出逐数据集明细。

提出 Net Utility:对每个任务 LoRA 的 SVD 奇异方向,用归一化的自身任务收益减去跨任务干扰打分,分数无量纲因而可跨任务比较,并在总预算约束下全局取最高分方向。 与 AdaRank 需无标注校准数据与梯度下降、PRIME 归结为单一共享秩不同,该指标仅依赖适配器权重,是闭式、免数据、无优化循环的,且不显式选择某个秩——秩剖面由一次全局 top-k 选择自然产生。 方法推导包含可分离上界(Proposition 1)与净效用分解(Proposition 2),并在附录给出复杂度分析;SVD 可直接由 LoRA 因子计算,无需物化稠密更新。

在匹配预算下,Net Utility 分配在三种合并空间(full、core、KnOTS)与多种合并方法上普遍优于均匀分配,视觉平均 +2.1%、语言平均 +2.2%,部分方法-空间组合最高达 +3.8%。 收益随预算收紧而增大(如 TSV 在语言任务上从某预算的增益升至更紧预算的更大增益),说明预算越紧时“保留哪些方向”的选择越关键。 覆盖 7 个视觉任务(ViT-B/32)与 6 个语言任务(Qwen3-4B),每个方法在三个预算下评测,指标为归一化准确率;DARE 在 core 与 KnOTS 空间的语言任务上是例外,与均匀分配相差在约 1% 以内或略低。

分析显示最优方向集合不必是前缀:由于干扰由跨任务几何决定,低奇异值但与其他任务正交的方向可以胜过主导但被共享的方向;同时预算不必花完,因为净效用可为负。 这挑战了现有 SVD 类合并方法普遍采用的前缀截断做法,并给出模块/层级的非均匀分配图景(如 ViT-B/32 后层 value 与 output 投影需要更多秩)。 论文报告在视觉任务上多数所选集合非前缀,并给出净效用与任务难度的相关性分析(在 Hendrycks MATH 七个主题上,相对准确率与平均净效用呈负相关)。

启示与展望

该结果面向离线合并一组固定适配器的场景:在给定总秩预算下,为视觉(ViT-B/32,7 个任务)与语言(Qwen3-4B,6 个 NLI 任务)适配器选择保留哪些奇异方向。适用对象是需要在推理时避免热切换、又受秩预算约束的部署方,例如端侧或批处理服务。方法可直接叠加在 task arithmetic、TSV、DARE、TIES、Iso-C 等合并算子以及 full、core、KnOTS 三种合并空间之上,且不需要任务数据、验证集或前向传播。

净效用推导建立在线性合并与可分离上界之上,论文自述未针对具体合并算法重新推导,也未调优超参数 α;若给定验证集,调参可能进一步改变结果。DARE 在 core 与 KnOTS 空间的语言任务上未超过均匀分配,说明收益依赖方法-空间组合。加载文本为全文但表格以文本形式呈现,部分数值与逐任务明细无法完整核对,因此各方法-空间组合的具体增益区间仍属开放问题。此外,净效用与任务难度的相关性来自 Hendrycks MATH 单一受控实验,其普适性有待更多任务集检验。

来源