arXiv 2026年10月5日该工作针对现代选择性状态空间模型(如 Mamba2)在分布式学习中行为不明的问题,推导了单层与多层选择性 SSM 的架构感知梯度界与光滑性界,以及 FedAvg 与 FedProx 的收敛界,刻画循环稳定性、输入依赖离散化和状态投影范数如何影响联邦优化;随后用教师 SSM 生成序列对单层界做数值验证,并据此形成关于本地训练与客户端异质性的预期,再通过在六个文本域上比较九种联邦学习算法进行 Mamba2 语言建模来检验这些预期。该工作针对现代选择性状态空间模型(如 Mamba2)在分布式学习中行为不明的问题,推导了单层与多层选择性 SSM 的架构感知梯度界与光滑性界,以及 FedAvg 与 FedProx 的收敛界,刻画循环稳定性、输入依赖离散化和状态投影范数如何影响联邦优化;随后用教师 SSM 生成序列对单层界做数值验证,并据此形成关于本地训练与客户端异质性的预期,再通过在六个文本域上比较九种联邦学习算法进行 Mamba2 语言建模来检验这些预期。研究者为选择性状态空间模型推导架构感知的收敛界,并在六个文本域上比较九种联邦学习算法该工作针对现代选择性状态空间模型(如 Mamba2)在分布式学习中行为不明的问题,推导了单层与多层选择性 SSM 的架构感知梯度界与光滑性界,以及 FedAvg 与 FedProx 的收敛界,刻画循环稳定性、输入依赖离散化和状态投影范数如何影响联邦优化;随后用教师 SSM 生成序列对单层界做数值验证,并据此形成关于本地训练与客户端异质性的预期,再通过在六个文本域上比较九种联邦学习算法进行 Mamba2 语言建模来检验这些预期。该工作针对现代选择性状态空间模型(如 Mamba2)在分布式学习中行为不明的问题,推导了单层与多层选择性 SSM 的架构感知梯度界与光滑性界,以及 FedAvg 与 FedProx 的收敛界,刻画循环稳定性、输入依赖离散化和状态投影范数如何影响联邦优化;随后用教师 SSM 生成序列对单层界做数值验证,并据此形成关于本地训练与客户端异质性的预期,再通过在六个文本域上比较九种联邦学习算法进行 Mamba2 语言建模来检验这些预期。