跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

arXiv

Pivot-SD 只监督去噪中的高影响承诺,用 200 个问题让 LLaDA-8B-Instruct 在数学与代码基准上超过全序列 SFT 和同等预算的扩散 RL 基线

该工作提出 Pivot-SD,一种离线自蒸馏框架,用信息增益度量挑选去噪过程中能大幅降低其余掩码位置不确定性的高影响承诺(pivots),对成功轨迹的 pivots 用交叉熵训练、对失败轨迹的 pivots 用定向 unlikelihood 训练而保持失败轨迹其余部分不变,仅用 200 个问题和每条四次 rollout,就在数学与代码基准上使 LLaDA-8B-Instruct 优于全序列 SFT 和预算匹配的扩散 RL 基线。