清华团队综述参数高效微调:LoRA在GPT-3上仅训练4.7M参数即省99.97%并可略优于全量微调
核心概要
这篇由清华大学知识工程组撰写的综述系统梳理了面向基础模型(FM)的参数高效微调(PEFT)技术,将方法归纳为选择性、加性、提示、重参数化和混合五大类,并按大语言模型、视觉基础模型、视觉语言模型、视觉内容生成模型和多模态基础模型五类模型结构分别综述其应用,同时基于Semantic Scholar引用量给出三条趋势判断(PEFT整体快速增长;LLM与VFM主导;MFM相对欠探索),并指出可靠性、可解释性和统一基准等未来方向。
深度剖析
综述提出并统一了PEFT的五类分类体系:选择性PEFT(如BitFit、PASTA、FISH)、加性PEFT(如Bottleneck Adapter、MAD-X、AdapterDrop)、提示PEFT(如Prefix Tuning、Prompt Tuning、P-Tuning v2)、重参数化PEFT(如LoRA、QLoRA、MPO)和混合PEFT(如UniPELT、COMPACTER、S4),并配以表格统计各方法的可训练参数占比。 此前综述(Xin等、Han等、Zhou等、Wang等)多聚焦单一方向(视觉PEFT、LLM算法或方法论),本文将这些分散的洞见整合为跨五类FM的统一分类与对比。 以表格形式汇总各方法的发表venue、适用FM类型、微调位置和可训练参数百分比,例如BitFit为0.01%–0.09%、LoRA为0.02%–0.31%、ControlNet为22.8%–24.7%。
综述以GPT-3为例量化PEFT的成本效益:全量微调涉及全部175B参数,而LoRA仅需训练4.7M或37.7M参数,节省超过99.97%的参数,且结果相比全量微调有0.1%到0.5%的提升。 用一个具体可比的数字把“参数高效”从定性描述变为可核验的量级对比,并指出PEFT并非总是略逊于全量微调。 该数字来自综述正文对GPT-3与LoRA的对比陈述,属于对已有工作的引用性总结,而非本文新实验。
综述基于Semantic Scholar引用量统计给出三条趋势:PEFT领域整体快速增长并覆盖语言、视觉和多模态任务;LLM与VFM主导当前研究格局,VLM和VGM作为次级方向正在获得关注;MFM相对欠探索,存在显著研究机会。 把“PEFT很热”这一印象转化为按模型类型分列、按年份展开的引用量趋势图,并据此指出MFM是相对空白区。 趋势判断基于图1中按LLM、VFM、VLM、VGM、MFM分列的逐年引用量统计,属于文献计量层面的证据。
综述按五类FM分别梳理应用:LLM部分区分因果LLM(如LLaMA-adapter仅需1.2M可训练参数)与前缀LLM(如P-tuning系列以0.1–0.3%参数微调ChatGLM);VFM部分覆盖图像识别与视频理解;VGM部分以扩散模型为主,LoRA、ControlNet和Adapter类方法最常用;MFM部分指出LoRA与Q-Former在Monkey、mPLUG-Owl、CogVLM、GLM-4V等模型中流行。 将同一套PEFT分类贯穿到五类模型结构中,展示方法如何随架构(Transformer块、去噪U-Net、3D U-Net)而变体。 以大量具体方法名和参数占比支撑,例如I2V-Adapter仅微调基础扩散模型1%的参数、LLaMA-Adapter V2为0.0006%。
启示与展望
本综述面向需要在有限算力或存储下把基础模型适配到下游任务的读者,包括研究者与工程实践者;其分类框架适用于语言、视觉、视觉语言、视觉生成和多模态五类模型结构。读者可据此为具体模型(如LLaMA、ChatGLM、ViT、Stable Diffusion、LLaVA)选择选择性、加性、提示、重参数化或混合PEFT方案,并参考文中给出的可训练参数占比做初步预算。综述也把跨学科(如医学影像中引入领域知识与低维先验)、持续PEFT、面向架构的PEFT设计、PEFT的缩放规律以及类脑PEFT列为未来方向。
本次读取的文本为不完整范围,图表(图1至图6)与部分表格在文本中以占位或排版形式出现,具体数值与图示细节无法完整核对,因此对趋势统计和部分参数占比的复述以正文明确写出的数字为准。综述本身指出PEFT方法对超参数(瓶颈维度、秩、层顺序)敏感,且最优学习率通常远高于全量微调;不同PEFT方法的可解释性仍是挑战;领域内缺乏统一基准,不同研究使用不同数据集与任务设置,导致性能评估标准不一致。这些是读者在采用具体方法时需要继续关注的问题。
