跳到主要内容
返回时间线
arXiv来源发表:

冻结扩散语言模型特征空间中的MMD后训练:MDLM-MMD与ELF-MMD在同等熵下降低生成困惑度,16B DMax在数学与代码基准上提高解码并行度

相关研究与后续进展

核心概要

该工作提出一种扩散语言模型后训练方法,在冻结预训练扩散语言模型的上下文词元特征空间中最小化生成分布与参考分布之间的最大均值差异(MMD),对离散模型用REINFORCE加留一基线优化、对连续模型直接对生成隐变量求导,从而无需完整采样轨迹或联合训练的辅助模型;在OpenWebText上于同等熵下取得更低生成困惑度,在GSM8K上改善精度—计算权衡,并在16B DMax-LLaDA2.0混合掩码—均匀扩散模型上以相近或更高精度提升解码并行度。

AI-generated editorial illustration: Representation-Space MMD for Diffusion Language Models

深度剖析

提出以冻结预训练扩散语言模型的上下文词元特征作为MMD比较空间,并保留逐位置特征,使一次提取器前向即可从单条序列获得多个观测,用于分布匹配。 此前视觉生成中的MMD类目标依赖预训练特征空间,而语言侧的特征匹配(如EBFT)以单个特征向量表示一次 rollout;这里改为在词元级特征上用RBF核比较分布,并给出排除同序列词元对的估计量以保持无偏。 论文给出式(4)的序列级核平均与式(5)的批内估计,并说明同序列词元对可能相关、保留会引入偏差;消融显示词元级RBF优于线性核、序列级RBF、仅吸引项与特征回归。

离散扩散语言模型上以REINFORCE优化MMD奖励,并用独立批次构成留一基线降低梯度方差,实例化为MDLM-MMD与DMax-MMD。 与依赖教师去噪目标或联合训练辅助模型的蒸馏方法(如IDLM、DiDi-Instruct)不同,奖励直接由冻结特征中的MMD计算,不需要完整采样轨迹或辅助模型。 在OpenWebText上以MDLM为初始化、组大小g=4,报告在匹配熵下生成困惑度低于DiDi-Instruct、IDLM与IDLM-REINFORCE;在TinyGSM/GSM8K上以置信阈值解码扫描,报告在中等与高解码预算下精度更高,达到某精度所需步数更少。

连续扩散语言模型上直接对生成隐变量求导,实例化为ELF-MMD,并通过自条件迭代精化扩展到多步采样,可选地再做迭代精化蒸馏(IRD)。 与渐进蒸馏、流映射等需要教师轨迹的方法相比,MMD阶段不使用成对教师轨迹;IRD作为可选的后置轨迹监督阶段单独存在。 在T5与GPT-2两种隐空间、多个采样步数下报告生成困惑度与熵的权衡改善;在GSM8K上报告4步与8步精度提升,64步时ELF-MMD+IRD达到该组最高精度;附录报告ELF⋆-MMD与FMLM-MMD在各自基线上各采样预算均有提升。

在16B DMax-Math与DMax-Coder上验证可扩展性:用MMD同时训练掩码输入与模型自身词元预测,400步训练后提升解码并行度(TPF)并保持或提高精度。 把词元级MMD后训练从中小规模实验推进到已发布的16B混合掩码—均匀扩散检查点,并同时报告精度与每前向生成词元数这一并行度指标。 报告在八个NVIDIA H100上训练400步,DMax-Math约若干分钟、DMax-Coder约若干分钟;四个数学基准上TPF相对原DMax工作点提高,精度相近或更高;HumanEval-Instruct与MBPP-Instruct上精度分别提高若干百分点且TPF上升。

启示与展望

该结果面向扩散语言模型的后训练阶段:离散模型(MDLM、DMax)与连续模型(ELF)均可使用,训练时只需冻结的预训练扩散语言模型作为特征提取器与参考样本,不需要完整采样轨迹或联合训练的辅助模型。适用场景包括无条件文本生成(OpenWebText)与条件数学推理(TinyGSM训练、GSM8K评测),以及16B规模的数学与代码基准。方法在推理时沿用各模型原有采样流程,连续模型可叠加自条件迭代精化与可选的IRD。

性能依赖RBF带宽与所选表示空间,论文把表示设计列为后续方向;作者使用单层、干净输入的特征,跨层或跨噪声水平的组合尚未验证。离散模型的MMD奖励依赖策略梯度与组大小,论文报告组大小从1增至4带来主要增益、继续增大收益有限。连续模型的迭代精化与IRD是可选阶段,其收益与训练成本的平衡仍需按任务权衡。此外,所提供的文本中若干表格数值不完整,因此部分具体数字无法在此逐项核对,读者应以原文表格为准。

来源