跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

arXiv

Muon 有限步 Newton–Schulz 正交化首次获得训练损失保证:达到任意目标损失 ε 的命中时间为 O((1-μ)^{-1}ε^{-1/2})

该工作针对 Muon 优化器在动量累积与调优有限步 Newton–Schulz 正交化下的收敛问题,证明在足够宽的两层 ReLU 网络全批量训练中,只要学习率与 (1-μ)√ε 成正比,Muon 即可以高概率达到任意目标经验平方损失 ε,命中时间上界为 O((1-μ)^{-1}ε^{-1/2}),且所需宽度与目标精度和动量无关。