跳到主要内容
返回时间线
arXiv来源发表:

把掩码扩散解码拆成五个轴后,研究者发现状态自适应只在少数可预测状态上值得做,选择性干预让三个模型的整任务宏平均效用分别提升3.2、4.0和5.6个百分点

核心概要

该工作把掩码扩散语言模型的解码策略拆成 score、cardinality、region、commitment、planning 五个轴,用“策略反转”定义自适应机会(最优候选动作相对验证集选出的固定动作的一步效用优势),在三个模型(LLaDA-8B-Instruct、LLaDA-1.5、Dream-7B)和十个任务上发现自适应机会高度异质,并据此提出选择性自适应:用验证提示校准的轻量检测器识别高机会状态,例如在 LLaDA-8B 的 Constrained JSON Fill 上只对排名前 10% 的状态做 region 自适应即可捕获 56.9% 的候选集 oracle 机会,端到端选择性解码把任务宏平均效用从 0.392

AI-generated editorial illustration: Unmask the State: When Does State Adaptation Matter for Masked Diffusion Language Models

深度剖析

论文把掩码扩散推理统一为 score、cardinality、region、commitment、planning 五个轴的决策空间,并用定理1的“反转分解”把自适应价值写成反转发生频率与平均可用效用边际的乘积,说明小的全局自适应差距可能来自反转稀少、边际很小或两者兼有。 此前工作分别提出置信度、熵、KL 稳定性、块/膨胀区域、重掩码、前瞻搜索等具体规则,但很少把“何时该改变选择”本身作为研究对象;这里把已有方法映射到同一组轴上,并给出自适应价值何时非零的结构性刻画。 定理1给出形式化分解与下界;附录把 LLaDA、Fast-dLLM、KLASS、DUS、ReMDM、WINO、Info-Gain 等方法逐条映射到五轴表,属于概念与理论层面的贡献。

在三个模型和十个任务上,自适应机会高度异质:LLaDA-8B 的候选集 oracle 差距约 0 到 0.0454,LLaDA-1.5 约 0 到 0.0450,Dream 约 0 到 0.1325,最强轴随模型和任务变化,许多设置下固定动作仍然有竞争力。 以往常把“自适应解码更好”当作默认前提,这里用交叉拟合的候选集 oracle 差距逐任务、逐轴量化,指出机会集中在结构化任务(如 Constrained JSON Fill、Unique List Commit、HTML Close Tags、Carry RTL)而非普遍存在。 每个任务最多 100 个评估提示(JSON Mode Eval 为 68 个),每个提示采样 8 个间隔状态,每个状态-动作对用 4 次延续 rollout 估计一步效用,候选集 oracle 采用两折 rollout 交叉拟合;附录给出提示级 bootstrap 95% 区间。

存在 oracle 机会不等于能被利用:模型级平均 AUROC 约为 LLaDA-8B 0.5、LLaDA-1.5 0.5、Dream 0.6,只有少数任务-轴设置出现正的选择性提升;例如 Dream 的 JSON Mode Eval/score 达到 AUROC 0.891 却在前 10% 捕获 0% 的 oracle 效用质量,说明二分类检测与效用相关排序是两件事。 论文把“动作选择”(轴诊断提出候选动作)与“机会检测”(验证集校准的检测器决定是否偏离固定动作)明确分开评估,而不是假设一个自适应控制器同时解决两者。 检测器只用验证提示做分位分箱校准,不接触留出 rollout 效用;报告 AUROC、Spearman 相关、正状态精确率/召回率、覆盖率下的机会捕获,并与随机覆盖和 oracle 门控对照。

选择性自适应在一步层面和端到端层面都能带来收益:LLaDA-8B Constrained JSON Fill/region 在前 5%、10%、20% 覆盖率下分别捕获 35.3%、56.9%、84.3% 的 oracle 机会,实现的一步提升在 10% 覆盖率后饱和于 +0.0594;端到端选择性解码把任务宏平均效用从 0.392 提升到 0.424(LLaDA-8B)、0.344 到 0.384(LLaDA-1.5)、0.411 到 0.467(Dream),而始终启用诊断的自适应整体更弱(0.370、0.334、0.447)。 这给出一个条件性结论:当机会可预测且动作诊断有用时,有限覆盖率的选择性一步自适应能恢复可观的局部效用;收益来自“决定何时干预”而非无条件自适应。 覆盖率-效用表给出 5%/10%/20%/50%/100% 五档结果,并与随机覆盖、oracle 门控对照;端到端结果在预先固定的十任务套件上报告,选择性自适应在 LLaDA-8B 提升 3/10 任务、LLaDA-1.5 提升 4/10、Dream 提升 3/10,退化分别为 0、1、1 个任务。

启示与展望

该结果面向掩码扩散语言模型的推理期解码,适用于可以采样状态、估计一步效用并拥有验证提示的场景;论文把 planning 轴固定,只研究 score、cardinality、region、commitment 四个转移级轴,且一次只改变一个轴。它主要服务于希望在不重训模型的前提下改进解码的研究者与工程实现者,适用设置是结构化或约束性较强的生成任务(如 Constrained JSON Fill、Unique List Commit、HTML Close Tags、Carry RTL),在这些制度下机会集中且可预测。

检测器在多数设置下接近随机,论文自身报告模型级平均 AUROC 约为 0.5、0.5、0.6,只有少数任务-轴出现正的选择性提升,因此哪些制度可预测仍是开放问题。端到端结果中部分任务没有提升甚至退化(如 LLaDA-1.5 Multi-span Cloze 为 -0.040、Dream Unique List Commit 为 -0.028),说明一步效用与终端质量之间的关系需要更多任务验证。此外,论文把 planning 轴固定、一次只改一个轴,多轴联合自适应是否更好尚未回答;本总结基于全文文本,未逐张核对附录表格与图,若需精确数值请回到原文附录。

来源