跳到主要内容
返回时间线
arXiv来源发表:

研究者为选择性状态空间模型推导架构感知的收敛界,并在六个文本域上比较九种联邦学习算法

相关研究与后续进展

核心概要

该工作针对现代选择性状态空间模型(如 Mamba2)在分布式学习中行为不明的问题,推导了单层与多层选择性 SSM 的架构感知梯度界与光滑性界,以及 FedAvg 与 FedProx 的收敛界,刻画循环稳定性、输入依赖离散化和状态投影范数如何影响联邦优化;随后用教师 SSM 生成序列对单层界做数值验证,并据此形成关于本地训练与客户端异质性的预期,再通过在六个文本域上比较九种联邦学习算法进行 Mamba2 语言建模来检验这些预期。

Source-provided article image: Distributed Learning with Selective State Space Models: Architecture-Aware Convergence Analysis
Figure 1 ·

Figure 1: (a) A selective SSM layer generates input-dependent discretization parameters from xt and uses them to update the hidden state ht and output yt. (b) Federated SSM training proceeds over communication rounds: the server broadcasts W r, clients perform E local updates on local datasets Dk, and the resulting models are aggregated into W r+1.

arXiv · 第 3 页

深度剖析

论文给出了单层与多层选择性 SSM 的架构感知梯度界与光滑性界,并给出 FedAvg 与 FedProx 的收敛界,明确刻画循环稳定性、输入依赖离散化与状态投影范数对联邦优化的影响。 既有标准联邦学习方法大体上是架构无关的,未考虑现代选择性 SSM 的稳定性、选择性与状态空间参数化;该工作把这三类架构属性显式纳入优化分析。 证据来自作者自述的推导结果,摘要中未给出具体界的形式、常数或假设条件。

作者用教师 SSM 生成的序列对单层界进行数值验证,学习者遵循所分析的递推结构。 把理论界与受控的合成序列实验对应起来,而非仅停留在推导层面。 摘要仅说明验证对象为单层界与教师 SSM 生成序列,未报告误差量级、序列规模或实验设置细节。

作者由分析形成关于本地训练与客户端异质性影响的预期,并在 Mamba2 语言建模上比较九种联邦学习算法、覆盖六个文本域来检验这些预期。 将 SSM 专属界作为解读实际联邦学习算法行为的基础,把架构感知分析与真实模型上的算法比较联系起来。 证据为九种算法、六个文本域的比较实验;摘要未给出具体指标、数据集名称或性能差异数值。

启示与展望

该工作面向采用选择性 SSM(如 Mamba2)的分布式与联邦学习场景,适用于希望从架构属性出发理解联邦优化行为的读者。其分析对象是单层与多层选择性 SSM 的梯度与光滑性界,以及 FedAvg 与 FedProx 的收敛界;数值验证限于单层界与教师 SSM 生成的序列;算法比较限于 Mamba2 语言建模与六个文本域。据此,该框架可用于形成并检验关于本地训练与客户端异质性的预期,并为解读实际联邦学习算法提供依据。

摘要未给出界的具体形式、假设条件与常数,也未报告数值验证的误差量级、序列规模,以及九种算法在六个文本域上的具体指标与差异。因此,界在何种条件下最紧、数值验证与理论预测的吻合程度、以及算法比较中观察到的行为在多大程度上可由这些界解释,仍是读者需要查阅正文才能确认的开放问题。

来源