跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

arXiv

Clean 用 Nyström 草图把二阶优化器内存降到线性,单张 80GB GPU 可预训练 13B 模型

作者提出 Clean 与低精度变体 Q-Clean:用随机 Nyström 方法近似 SOAP 的左右预条件子,把优化器状态内存从随层维度二次增长降为线性,并把低秩核心之外的 Main、A、B、C 四个正交块重新整合进更新;在 C4 上预训练 LLaMA-350M 与 1.3B 时,Clean 困惑度接近 SOAP 而优化器内存小于 AdamW,Q-Clean 相比 Muon 减少超过 50% 优化器内存,Clean 达到 AdamW 最终性能的墙钟时间快 26%,并首次使 13B 模型可在单张 80GB H100 上预训练。