跳到主要内容
返回时间线
arXiv来源发表:

Muon 有限步 Newton–Schulz 正交化首次获得训练损失保证:达到任意目标损失 ε 的命中时间为 O((1-μ)^{-1}ε^{-1/2})

相关研究与后续进展

核心概要

该工作针对 Muon 优化器在动量累积与调优有限步 Newton–Schulz 正交化下的收敛问题,证明在足够宽的两层 ReLU 网络全批量训练中,只要学习率与 (1-μ)√ε 成正比,Muon 即可以高概率达到任意目标经验平方损失 ε,命中时间上界为 O((1-μ)^{-1}ε^{-1/2}),且所需宽度与目标精度和动量无关。

Source-provided article image: Training-Loss Guarantees for Muon with Finite-Step Newton--Schulz Orthogonalization
Figure 1 ·

Figure 1: Training loss across accuracy targets and momentum values. (a) Loss curves for five target values of ε \varepsilon at μ = 0.95 \mu=0.95 ; dots mark the first iteration reaching each target. (b) Hitting time versus ε \varepsilon , with an ε − 1 / 2 \varepsilon^{-1/2} reference line. (c) Loss curves for five momentum values at target 10 − 2 10^{-2} , using η = ( 1 − μ ) ​ η 0 \eta=(1-\mu)\eta_{0} with η 0 = 1.54 × 10 − 4 \eta_{0}=1.54\times 10^{-4} . (d) The curves in (c) plotted against ( 1 − μ ) ​ t (1-\mu)t . Panels (a,b) use a separate data draw ( λ 0 ≈ 0.34 \lambda_{0}\approx 0.34 , R 0 ≈ 26 R_{0}\approx 26 ); panels (c,d) use the saved draw ( λ 0 = 0.335 \lambda_{0}=0.335 , R 0 = 30.2 R_{0}=30.2 ).

arXiv

深度剖析

论文给出了 Muon 的有限时间训练损失保证,而非仅收敛到稳定点:对足够宽的两层 ReLU 网络、固定随机输出权重与正定极限神经正切核,全批量训练下 Muon 以高概率达到任意目标经验平方损失 ε>0。 此前的 Muon 收敛分析要么假设精确正交化,要么分析经典 Newton–Schulz 多项式,且只保证稳定点;该工作把动量累积与调优后的有限步更新同时纳入分析,把结论从稳定点推进到训练损失。 结论以定理形式给出,条件明确列出:足够宽的两层 ReLU 网络、固定随机输出权重、正定极限神经正切核、全批量训练,并以初始化上的高概率成立。

对每个动量参数 μ∈[0,1),存在与目标相关的常数学习率,正比于 (1-μ)√ε,使命中时间上界为 O((1-μ)^{-1}ε^{-1/2}),且所需足够宽度与目标精度和动量均无关。 这给出了学习率、动量与目标精度之间的显式定量关系,并说明宽度条件不随精度要求或动量选择而收紧。 该速率与宽度无关性均在定理中陈述,其他问题参数保持固定;摘要未给出常数因子的具体数值。

分析刻画了机制:调优的 Newton–Schulz 映射在限制更新谱范数的同时保持与动量缓冲区的对齐,初始化附近梯度变化的控制把这种对齐传递到当前梯度,从而在不需要精确正交化的前提下保证持续下降直至达到目标。 这把“五步调优 Newton–Schulz 究竟保留了什么”从经验观察提升为可证明的机制解释:保留的是与动量缓冲区的对齐,而非精确正交性。 机制来自理论分析,并由数值实验支持:在低于理论充分阈值的宽度下,梯度—更新对齐仍高于解析参考值。

数值实验在固定 teacher–student 数据集上验证机制:六个宽度、五种学生初始化共 30 次运行全部达到目标损失,并保持核正定性。 实验在低于理论充分宽度阈值的条件下复现了理论所预测的对齐与收敛行为,说明机制在理论阈值之外也有体现。 30 次运行、六个宽度、五种初始化,数据集固定;摘要未报告误差棒或超出该设定范围的统计量。

启示与展望

该结果适用于足够宽的两层 ReLU 网络、固定随机输出权重、正定极限神经正切核以及全批量训练这一设定,学习率取与目标相关的常数并正比于 (1-μ)√ε。在这一范围内,它说明调优的五步 Newton–Schulz 无需精确正交化即可保证下降,并给出宽度条件不随目标精度与动量收紧的结论,可供关注 Muon 理论性质与学习率—动量标度关系的研究者与工程实践者参考。数值实验进一步在低于理论充分阈值的宽度上检验了机制。

摘要未给出定理中常数因子的具体数值,也未说明高概率的具体概率形式;数值实验的误差范围与统计细节未在摘要中报告。理论设定为两层 ReLU、固定输出权重、正定极限核与全批量训练,向更深网络、其他激活与架构、小批量或自适应学习率设定的推广仍是开放问题。此外,摘要未说明实验所用目标损失的具体取值与教师—学生数据集的规模,这些细节需查阅正文。

来源