跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

arXiv

MuonIO 用 2→∞ 与 1→2 算子范数统一嵌入表与语言模型头的更新,在 1B LLaMA 预训练中把优化器状态内存减半、更新 FLOPs 降约 46% 并改善验证困惑度

MuonIO 针对标准 Muon 排除的嵌入表 E 与语言模型头 L,分别以 1→2 与 2→∞ 算子范数给出动机,并利用 ‖L‖_{2→∞}=‖Lᵀ‖_{1→2} 把两者统一为同一词汇导向几何下的单一归一化向量规则(E 为列归一化、L 为行归一化),在 C4 上 1B LLaMA 预训练中相比 Muon 将 I/O 优化器状态内存降低 50%、I/O 更新 FLOPs 降低约 46%,同时改善验证困惑度。