arXiv 2026年10月6日作者提出 Clean 与低精度变体 Q-Clean:用随机 Nyström 方法近似 SOAP 的左右预条件子,把优化器状态内存从随层维度二次增长降为线性,并把低秩核心之外的 Main、A、B、C 四个正交块重新整合进更新;在 C4 上预训练 LLaMA-350M 与 1.3B 时,Clean 困惑度接近 SOAP 而优化器内存小于 AdamW,Q-Clean 相比 Muon 减少超过 50% 优化器内存,Clean 达到 AdamW 最终性能的墙钟时间快 26%,并首次使 13B 模型可在单张 80GB H100 上预训练。作者提出 Clean 与低精度变体 Q-Clean:用随机 Nyström 方法近似 SOAP 的左右预条件子,把优化器状态内存从随层维度二次增长降为线性,并把低秩核心之外的 Main、A、B、C 四个正交块重新整合进更新;在 C4 上预训练 LLaMA-350M 与 1.3B 时,Clean 困惑度接近 SOAP 而优化器内存小于 AdamW,Q-Clean 相比 Muon 减少超过 50% 优化器内存,Clean 达到 AdamW 最终性能的墙钟时间快 26%,并首次使 13B 模型可在单张 80GB H100 上预训练。Clean 用 Nyström 草图把二阶优化器内存降到线性,单张 80GB GPU 可预训练 13B 模型作者提出 Clean 与低精度变体 Q-Clean:用随机 Nyström 方法近似 SOAP 的左右预条件子,把优化器状态内存从随层维度二次增长降为线性,并把低秩核心之外的 Main、A、B、C 四个正交块重新整合进更新;在 C4 上预训练 LLaMA-350M 与 1.3B 时,Clean 困惑度接近 SOAP 而优化器内存小于 AdamW,Q-Clean 相比 Muon 减少超过 50% 优化器内存,Clean 达到 AdamW 最终性能的墙钟时间快 26%,并首次使 13B 模型可在单张 80GB H100 上预训练。作者提出 Clean 与低精度变体 Q-Clean:用随机 Nyström 方法近似 SOAP 的左右预条件子,把优化器状态内存从随层维度二次增长降为线性,并把低秩核心之外的 Main、A、B、C 四个正交块重新整合进更新;在 C4 上预训练 LLaMA-350M 与 1.3B 时,Clean 困惑度接近 SOAP 而优化器内存小于 AdamW,Q-Clean 相比 Muon 减少超过 50% 优化器内存,Clean 达到 AdamW 最终性能的墙钟时间快 26%,并首次使 13B 模型可在单张 80GB H100 上预训练。