跳到主要内容
返回时间线
arXiv来源发表:

Muon 的光谱正交化让线性 Transformer 更快学会事实:学习时间比从 √(S/R) 降到常数级

相关研究与后续进展

核心概要

该工作用可解析的事实回忆模型研究 Muon 的光谱正交化机制:在 S 个主体、R 个关系且 S>R 时,梯度流先学关系后学主体,学习时间比为 Θ̃(√(S/R)),而光谱梯度流把该比值降到 Θ̃(1),并使主体与关系误差分别以 1/(T log T) 和 exp(-poly(T)) 衰减;梯度流与光谱梯度流对 token 嵌入的正交变换等变,Sign 梯度流则不等变,不同正交嵌入可导致无特征分离、长分离期甚至学习顺序反转。

Source-provided article image: Muon Learns Facts Better: Understanding the Role of Spectral Orthogonalization
Figure 8 ·

Figure 8: SGD, AdamW, and Muon in realistic factual recall task learned by Pythia 35M. The solid line stands for the overall error rate, the dashed line stands for the error probability of the prediction having the wrong subject entity, and the dotted line stands for the error probability of the prediction having the wrong relation entity.

arXiv

深度剖析

在事实回忆模型中,光谱正交化显著压缩了主体信息与关系信息的学习时间差:梯度流的学习时间比为 Θ̃(√(S/R)),光谱梯度流将其降为 Θ̃(1)。 此前 Nichani 等(2025)已表明 S>R 时梯度流先学关系依赖信息、后学主体依赖信息并形成特征分离阶段,但未刻画该分离在 Muon 类更新下的时间尺度;本文用主体与关系分量达到目标精度所需学习时间之比来量化这一分离。 基于线性 Transformer 在事实回忆任务上的连续时间极限分析,给出梯度流、光谱梯度流与 Sign 梯度流三种优化下的学习时间比渐近结果,属于理论刻画而非大规模实验测量。

对固定的 S 与 R,梯度流下主体与关系误差随训练时间 T 以 1/(T log T) 衰减,而光谱梯度流下以 exp(-poly(T)) 衰减。 把两种优化器的差异从最终性能推进到误差随训练时间的衰减速率层面,说明光谱正交化改变的是收敛阶而非仅常数因子。 来自连续时间梯度流与光谱梯度流的解析推导,给出误差衰减的函数形式;结论适用于该事实回忆模型设定。

梯度流与光谱梯度流对 token 嵌入的正交变换等变,Sign 梯度流不等变;不同正交嵌入可产生无特征分离、较大特征分离阶段,甚至反转的学习顺序。 揭示了 Adam 类 Sign 更新在嵌入正交变换下缺乏等变性,从而学习动态依赖具体正交嵌入选择,而 Muon 类光谱更新不受此影响。 通过等变性分析与构造性说明给出,属于理论层面的性质区分。

启示与展望

该结果面向研究优化器机制与特征学习动态的读者,尤其是关注 Muon 与 Adam 类更新差异的理论与工程人员。结论在事实回忆模型这一设定下成立:事实由主体-关系对映射到答案,线性 Transformer 学习恢复该映射所需的主体与关系依赖信息,优化过程用梯度流、光谱梯度流与 Sign 梯度流三种连续时间极限刻画。在这一范围内,它给出了学习时间比与误差衰减的定量预测,并说明光谱正交化可使学习动态对 token 嵌入的正交变换保持不变。

读者仍需留意:这些结论建立在连续时间极限与线性 Transformer 的简化设定上,与离散优化、非线性网络及真实预训练之间的差距尚待明确;学习时间比与误差衰减的常数与对数因子在有限规模下的实际影响需要进一步观察;不同正交嵌入导致学习顺序反转的现象在更复杂任务中的普遍性仍是开放问题。本次仅依据摘要整理,正文中的定理条件、证明细节与任何实验图表未纳入,因此对结论适用条件的完整边界仍需查阅原文。

来源