arXiv 2026年10月5日该工作针对 Muon 优化器在动量累积与调优有限步 Newton–Schulz 正交化下的收敛问题,证明在足够宽的两层 ReLU 网络全批量训练中,只要学习率与 (1-μ)√ε 成正比,Muon 即可以高概率达到任意目标经验平方损失 ε,命中时间上界为 O((1-μ)^{-1}ε^{-1/2}),且所需宽度与目标精度和动量无关。该工作针对 Muon 优化器在动量累积与调优有限步 Newton–Schulz 正交化下的收敛问题,证明在足够宽的两层 ReLU 网络全批量训练中,只要学习率与 (1-μ)√ε 成正比,Muon 即可以高概率达到任意目标经验平方损失 ε,命中时间上界为 O((1-μ)^{-1}ε^{-1/2}),且所需宽度与目标精度和动量无关。Muon 有限步 Newton–Schulz 正交化首次获得训练损失保证:达到任意目标损失 ε 的命中时间为 O((1-μ)^{-1}ε^{-1/2})该工作针对 Muon 优化器在动量累积与调优有限步 Newton–Schulz 正交化下的收敛问题,证明在足够宽的两层 ReLU 网络全批量训练中,只要学习率与 (1-μ)√ε 成正比,Muon 即可以高概率达到任意目标经验平方损失 ε,命中时间上界为 O((1-μ)^{-1}ε^{-1/2}),且所需宽度与目标精度和动量无关。该工作针对 Muon 优化器在动量累积与调优有限步 Newton–Schulz 正交化下的收敛问题,证明在足够宽的两层 ReLU 网络全批量训练中,只要学习率与 (1-μ)√ε 成正比,Muon 即可以高概率达到任意目标经验平方损失 ε,命中时间上界为 O((1-μ)^{-1}ε^{-1/2}),且所需宽度与目标精度和动量无关。