GenFT:面向预训练基础模型的生成式参数高效微调方法
核心概要
该工作提出 GenFT,一种以预训练权重 W0 为条件的参数高效微调方法,用确定性生成器对 W0 做行、列变换并配合共享-专属分解来生成任务专属更新 ΔW,在 GLUE(RoBERTaBase,平均 85.87%,0.24M 参数)、VTAB-1K(ViT-B/16,平均 74.50%,0.27M 参数)与 FGVC(平均 90.38%,0.29M 参数)上取得与代表性 PEFT 基线相当或更好的平均表现,并在 LLaMA-7B 的 Alpaca 子集上做了困惑度试点验证。
Fig. 1: Comparison of LoRA and GenFT. LoRA (left) learns task-specific updates under Eq. (1). GenFT (middle) follows the conditional motivation in Eq. (2). The GenFT generator (right) produces ∆W (ℓ) = Gθ(W (ℓ)
· 第 4 页深度剖析
把 PEFT 从“独立学习 ΔW”改写为“以 W0 为条件生成 ΔW”,并用确定性生成器 Gθ(W0) 实例化这一视角。 既有方法多通过初始化(如 PiSSA 用 W0 的 SVD 初始化适配器)、分解(如 DoRA 拆分幅度与方向)或逐元素交互来利用 W0,而 GenFT 让 W0 在优化全程作为生成更新的直接条件。 论文给出式(1)与式(2)的对比作为概念动机,并明确说明式(2)是概念性动机而非完整概率生成模型,实际以确定性生成器落地。
生成器由行变换与列变换组成,分别从 W0 的输出通道结构与输入特征结构中提取信息,并叠加非线性激活与掩码。 论文指出既有方法未显式建模 W0 的行、列变换来生成更新;GenFT 用 F_row = σ1(ratio·W0U)⊙Mp 与 F_col = σ2(F_row^T V)⊙Mp 生成 ΔW。 消融显示去掉行变换使 VTAB-1K 平均从 74.50 降至 70.56、FGVC 从 90.38 降至 89.96;去掉列变换分别降至 70.32 与 89.76。
共享-专属分解把变换因子拆成跨层共享部分(Us、Vs)与逐层专属部分(A(ℓ)、B(ℓ)),在很小参数预算下兼顾跨层复用与层间灵活性。 论文称该分解使 GenFT 在同等参数预算下可用比 LoRA 更大的潜在变换维度 a+b(附录 A 给出 2Da+2LDb=2LDr 的推导,得 r<a+b)。 消融中去掉共享配置的损失最大:VTAB-1K 平均降至 63.18、FGVC 降至 84.30;表 6 显示 GenFT 以 0.26M 参数在 Cifar 上达 71.50,而 LoRA 用 3.10M 参数为 65.79。
在 NLP 与 CV 多基准上取得有竞争力的平均成绩,并在 LLaMA-7B 上做了生成任务的可行性试点。 GLUE 上 GenFT 以 0.24M 参数取得 85.87% 平均分,高于 LoRA 的 83.99%;VTAB-1K 平均 74.50% 为表中最高;FGVC 平均 90.38% 为表中最高。 GLUE 上 GenFT 在 STS-B 排第四、QQP 与 QNLI 排第三;LLaMA-7B 试点仅用随机抽取的 1,000 条样本、比较困惑度,且 GenFT 需要更大学习率(3×10⁻³ 对 1×10⁻⁴)。
启示与展望
该结果面向需要在有限参数与显存预算下适配预训练基础模型的场景:GLUE 用 RoBERTaBase、VTAB-1K 与 FGVC 用 ViT-B/16,训练后 ΔW 可物化并合并进 W0+ΔW,因此额外生成器成本主要落在训练阶段。它为进一步探索“以 W0 为条件生成更新”这一方向提供了可复用的组件(行/列变换、共享-专属分解、潜在变换维度 a+b 的调节),适合研究 PEFT 方法设计、并希望在视觉与语言任务上同时获得稳定平均表现的研究者与工程实践者参考。
生成式模型部分目前是资源受限下的试点:仅用 Alpaca 中随机抽取的 1,000 条样本、以困惑度比较,且 GenFT 需要比 LoRA 与 PiSSA 更大的学习率(3×10⁻³ 对 1×10⁻⁴),论文将其归因于扩展的秩空间并指出优化动态不同、有待更大规模实验。此外,GLUE 上 GenFT 在 STS-B、QQP、QNLI 上并非第一,论文提到这些任务对超参数配置较敏感;潜在变换维度 a+b 也不应被理解为最终 ΔW 的精确代数秩,因为非线性激活与掩码会改变矩阵秩。读者可继续关注:更大规模生成任务上的表现、超参数敏感性的来源,以及行/列信息可视化所反映的变换差异在更多任务上是否一致。
