Pivot-SD 只监督去噪中的高影响承诺,用 200 个问题让 LLaDA-8B-Instruct 在数学与代码基准上超过全序列 SFT 和同等预算的扩散 RL 基线
相关研究与后续进展核心概要
该工作提出 Pivot-SD,一种离线自蒸馏框架,用信息增益度量挑选去噪过程中能大幅降低其余掩码位置不确定性的高影响承诺(pivots),对成功轨迹的 pivots 用交叉熵训练、对失败轨迹的 pivots 用定向 unlikelihood 训练而保持失败轨迹其余部分不变,仅用 200 个问题和每条四次 rollout,就在数学与代码基准上使 LLaDA-8B-Instruct 优于全序列 SFT 和预算匹配的扩散 RL 基线。
Figure 1: Predictive Entropy and Pivot Selection. An entropy heatmap of a masked denoising trajectory for a MATH problem (showing the first 128 tokens). The x-axis represents the token position, and the y-axis denotes the denoising step progressing downward. The color scale indicates the predictive entropy of the active masked positions. Red dashed lines and stars denote the critical denoising steps and the specific pivot tokens selected by our Information Gain metric, respectively.
arXiv深度剖析
论文指出掩码扩散语言模型存在独特的信用分配难题:去噪过程中少数几个承诺会急剧降低其余掩码位置的不确定性,并塑造了响应的大部分内容。 此前多数 dLM 后训练配方并不利用这一信号来决定训练哪些 token,通常训练最终文本或把奖励分配给整个去噪步骤,而不是挑选塑造响应的单个承诺。 该判断来自论文对现有后训练做法的归纳性描述,属于问题设定层面的论证,而非实验测量。
Pivot-SD 用信息增益度量选择 pivots,该度量衡量的是对剩余掩码位置的不确定性降低程度。 把“哪些 token 值得监督”从整段文本或整步奖励,转为以不确定性降低为标准的逐承诺选择。 论文给出了该选择准则的定义与用途,摘要层面未提供该度量的消融或敏感性分析。
训练信号按轨迹结果分流:成功轨迹的 pivots 用交叉熵,失败轨迹的 pivots 用定向 unlikelihood,失败轨迹的其余部分保持不变。 相比对失败轨迹整体施加惩罚或整体丢弃,这里只针对被判定为高影响的承诺施加负向信号。 该设计在摘要中被明确陈述,但未给出各组件单独的对照实验数据。
仅用 200 个问题和每条四次 rollout,Pivot-SD 在数学与代码基准上使 LLaDA-8B-Instruct 优于全序列 SFT 和预算匹配的扩散 RL 基线。 在数据量与算力预算受限的条件下取得相对既有后训练基线的提升,说明监督位置的选取本身可以替代一部分数据规模。 证据为摘要中报告的基准比较,涉及数学与代码两类任务,并设置了全序列 SFT 与预算匹配的扩散 RL 两个对照;具体数值、基准名称与统计细节未在文本中给出。
启示与展望
该工作面向掩码扩散语言模型的后训练阶段,尤其是需要以有限问题数与 rollout 预算提升数学与代码推理表现的场景;其目标读者是从事 dLM 训练与后训练配方设计的研究者与工程师。方法被描述为离线自蒸馏框架,因此适用于可以生成成功与失败轨迹并对其打分、再离线挑选 pivots 的设定。摘要中报告的比较对象为全序列 SFT 与预算匹配的扩散 RL 基线,说明该结果意在替代或补充这类后训练流程,而非替代预训练或推理阶段的解码策略。
摘要未给出具体基准名称、提升幅度、方差或显著性信息,因此无法从文本判断改进的稳健程度。信息增益度量中的阈值或选择比例、pivots 数量对结果的影响,以及定向 unlikelihood 的权重设置,均未在文本中说明。200 个问题与四次 rollout 的预算下,结果对问题分布与采样随机性的敏感性仍是开放问题。此外,文本未报告该框架在 LLaDA-8B-Instruct 之外模型上的表现,也未说明与全序列 SFT、扩散 RL 基线在训练成本上的完整对比。
