跳到主要内容
返回时间线
arXiv来源发表:

nGPT 训练配方让 30B 混合 Mamba-2–Transformer MoE 模型用约一半 token 达到相同验证损失

核心概要

本文提出一套面向归一化 Transformer(nGPT)的实用训练配方,包含 Logit Gradient Preconditioning、对数学习率衰减、GatedAdamW、角度更新控制以及可选的探索机制,并在现代混合 Mamba-2–Transformer 专家混合(MoE)模型上评估;与采用 AdamW 训练的、相同混合 MoE 架构的未归一化模型相比,总参数 30B 的 nGPT 模型用大约一半的训练 token 即达到相同的验证损失,且该配方在所考察的、总参数最高达 30B 的模型上均可扩展。

Source-provided article image: Training nGPT
Figure 1 ·

Figure 1: nGPT’s forward pass as a multi-step optimization on the hypersphere.

arXiv

深度剖析

论文给出了一套针对 nGPT 的实用训练配方,其组成包括 Logit Gradient Preconditioning、Logarithmic Learning Rate Decay、GatedAdamW、角度更新控制(angular update control)以及可选的探索机制(optional exploration mechanisms)。 nGPT 此前以超球面表示学习为出发点,将模型参数向量与激活向量约束在单位超球面上;本文的增量在于把这一约束下的训练流程具体化为可操作的配方组件,而非仅停留在表示形式的描述。 证据来自摘要中对配方组件的逐项列举,以及其在混合 Mamba-2–Transformer MoE 模型上的评估设置;文本未给出各组件的消融数据或单独贡献量化。

在相同混合 MoE 架构下,总参数 30B 的 nGPT 模型达到与未归一化、使用 AdamW 训练的对照模型相同的验证损失,所需训练 token 约为后者的一半。 这一比较把归一化约束与训练配方带来的效率差异,放在同架构、同验证损失口径下呈现,提供了 token 效率约 2 倍的对照结果。 证据为摘要中明确陈述的对照比较:同一混合 MoE 架构、未归一化模型 + AdamW 作为基线,指标为验证损失与训练 token 数;文本未报告具体损失数值、token 绝对量或多次运行的方差。

该训练配方在所考察的模型范围内具备可扩展性,覆盖总参数最高达 30B 的模型。 说明配方并非仅适用于单一规模,而是在从小到 30B 总参数的多个模型上被验证可沿用。 证据为摘要中“scales across the models considered”的表述,并给出 30B 总参数这一上限;文本未列出所考察模型的具体规模序列或每一规模的结果。

启示与展望

该工作面向在单位超球面约束下训练 nGPT 的实践者,适用场景是现代混合 Mamba-2–Transformer MoE 架构,规模覆盖至总参数 30B;其核心结论以验证损失与训练 token 数为衡量口径,对照条件为相同混合 MoE 架构、未归一化模型配 AdamW。配方中的可选探索机制意味着使用者可按需启用。对希望降低预训练 token 消耗、或计划在归一化表示约束下扩展模型规模的团队,这套配方提供了可直接参照的组件清单与对照基准。

文本为摘要级信息,未给出验证损失的具体数值、训练 token 的绝对量、所考察模型的完整规模列表,也未提供各配方组件的消融或单独贡献分析,因此无法判断哪一组件对 token 效率贡献最大。对照仅涉及同架构的未归一化 + AdamW 基线,其他优化器或架构下的表现仍是开放问题。此外,摘要未说明评估是否覆盖下游任务指标,验证损失之外的泛化表现有待正文确认。

来源