FedLore 用轮内共享、跨轮刷新的低秩梯度基座,在视觉与语言任务上超过所评估的低秩适配器基线并匹配或超过全参数训练,同时降低通信与优化器状态内存
核心概要
该工作提出 FedLore:在每一轮内共享一个低秩优化基座、跨轮刷新该基座,从而在低秩坐标中实现精确聚合并消除所识别的投影偏差,同时让累积模型更新超过每轮秩预算;作者刻画了聚合偏差,并在全局梯度覆盖条件与标准平滑性、方差假设及有界梯度异质性下为投影 SGD 变体建立 O(T^{-1/2}) 平稳性界;在视觉与语言任务(含联邦预训练)上,FedLore 超过所评估的低秩适配器基线,匹配或超过全参数训练,并降低通信与优化器状态内存。
Figure 2: Fixed-rank LoRA vs ours low-rank updates. FedLore shares a low-rank update basis within each round and refreshes it across rounds, allowing the accumulated model change to exceed the per-round rank.
arXiv深度剖析
论文识别并命名了“子空间碎片化”问题:客户端各自独立选择低秩子空间时,局部投影与数据异质性相互作用会偏置聚合方向,且聚合可能提高更新秩与通信成本,因此准确的局部梯度压缩并不必然保持全局下降。 相对基于 LoRA 的低秩适配器方法(其固定秩预算可能限制适配)以及此前独立选择客户端子空间的梯度低秩优化,该工作把问题定位在客户端子空间不一致这一环节,而非仅关注单客户端压缩精度。 该问题以概念刻画与聚合偏差分析的形式提出,摘要中说明作者刻画了聚合偏差;具体实验规模与数值未在摘要中给出。
FedLore 在每一轮内共享一个低秩优化基座并跨轮刷新,使低秩坐标中的聚合成为精确聚合并消除所识别的投影偏差,同时通过子空间刷新让累积模型更新超过每轮秩预算。 共享基座把“精确聚合”与“低秩通信”结合起来,而跨轮刷新突破了单轮固定秩预算对累积适配能力的限制。 方法机制在摘要中明确陈述;其效果由视觉与语言任务(含联邦预训练)的实验支持,摘要未列出具体数据集、模型规模或数值。
作者为投影 SGD 变体建立了 O(T^{-1/2}) 的平稳性界,条件包括全局梯度覆盖条件、标准平滑性与方差假设以及有界梯度异质性。 该结果为共享基座下的投影式联邦优化提供了收敛性刻画,并与所刻画的聚合偏差分析相配套。 属于理论结果,摘要给出收敛率与假设条件;证明细节与常数未在摘要中呈现。
在视觉与语言任务(包括联邦预训练)上,FedLore 超过所评估的低秩适配器基线,匹配或超过全参数训练,同时降低通信与优化器状态内存。 相对低秩适配器基线,它在保持或提升精度的同时减少通信与优化器状态内存;相对全参数训练,它不牺牲精度。 摘要报告了跨视觉与语言任务及联邦预训练的比较结果,但未给出具体指标数值、基线清单或消融规模。
启示与展望
该结果面向受客户端内存与通信成本约束的联邦基础模型训练场景,适用于采用低秩梯度优化与投影 SGD 式更新的联邦流程;对希望在视觉与语言任务(含联邦预训练)中降低通信与优化器状态内存、又不愿牺牲相对全参数训练精度的研究者与工程实践者具有参考价值。理论保证的适用范围由全局梯度覆盖条件、标准平滑性与方差假设以及有界梯度异质性界定。
读者仍需关注:共享基座在强异质性或参与方频繁变动时如何选择与刷新;全局梯度覆盖条件在实际联邦设置中如何满足;跨轮刷新带来的累积更新秩增长对通信与内存的实际影响;以及摘要未给出的具体数据集、模型规模、基线配置与数值结果,这些需要查阅正文表格与实验细节才能判断。由于本次仅基于摘要,无法核对图表与完整实验设置。
