HC-DLM 把连续隐状态当作唯一持久生成状态,在 Sudoku、Countdown 与 LM1B 上同时超过离散与连续扩散基线
核心概要
该工作提出层次化连续扩散语言模型 HC-DLM,让连续隐变量成为唯一跨步持久的生成状态、每一步从隐状态读出 token 并回馈为下一步隐更新的条件支架,其训练目标由 token 似然的变分下界导出;在同等模型规模下,它在 Sudoku 与 Countdown 的谜题准确率以及 LM1B 的生成困惑度上均优于离散与连续扩散基线。
深度剖析
HC-DLM 把反向过程组织成两级链:连续隐轨迹是唯一跨步持久的状态,每一步通过读出分布从当前隐状态读出 token,再经离散前向核重新加噪,作为下一步隐转移的条件。 与把连续上下文附加到自足离散链上的近期方法不同,这里 token 状态本身是生成模型的变量、拥有自己的前向核,且不携带自己的转移链,每个位置在每一步都被重新读出。 论文给出生成模型分解式(式 3)与推理算法(算法 2),并说明该组织同时决定训练与采样方式;文本为全文,含正文与附录。
作者为这一层次耦合链推导了 token 似然的变分下界,并把它化为可训练目标:重建项、编码器熵正则、以及每个时间步同时给出的离散 token 预测损失与连续去噪损失。 论文指出离散 token 预测子项与类别型离散扩散的 token 预测 KL 形式相同,因此 HC-DLM 在保留离散扩散监督的同时增加了连续去噪信号;连续部分用条件流匹配实现。 命题 1 给出 ELBO 及其分解,附录 A 给出 Jensen 不等式、连续项 telescoping、KL 链式分解与实用参数化的推导步骤。
在 Sudoku、Countdown 与 LM1B 三个任务上,HC-DLM 在匹配模型规模下优于离散与连续扩散基线:Sudoku 困难集 72.41 对 CCDD 的 70.73,Countdown CD5 为 37.52 对 25.35,LM1B 生成困惑度 75.5 优于所评估的全部扩散模型。 论文强调优势在训练中未出现的解策略上更明显(Sudoku 困难集),并在更长推理链的 CD5 上差距扩大;LM1B 上它优于所有离散扩散基线与两个只在最后解码一次的连续模型。 结果以表格形式给出,基线数值分别取自 Kim et al. (2025)、Ye et al. (2025) 与 LangFlow (Chen et al., 2026),CCDD 与 MDM 为作者在 6M 参数规模下按同一协议复现;LM1B 报告 1,024 个样本、128 步采样下的 GPT-2-Large 困惑度。
消融显示连续隐状态与离散支架两者都不可缺:去掉 token 层的 Latent DM 在 Sudoku 困难集降至 24.74,去掉隐层的 MDM 为 49.88,而完整模型为 72.41;同时均匀状态核明显优于吸收状态核。 论文用信息涌现分析说明,条件于离散支架使结构约束更早被锁定,中间步骤解码准确率更早上升并达到更高平台;在减少去噪步数时 HC-DLM 比纯离散 MDM 更稳健。 消融在 Sudoku 上进行,含框架选择表、噪声类型与 token 排序表、隐序列长度扫描,以及准确率随步数变化与墙钟时间对比。
启示与展望
该结果面向需要全局约束满足或双向计算的离散序列生成,例如逻辑谜题、算术规划与无条件语言建模;在这些设定下,读者可以把它当作“用共享连续隐状态承载跨 token 依赖、并让 token 每步回馈为支架”的可复现设计来使用。论文报告的是中等规模、可精确验证正确性的基准,作者指出所有模块都是标准 DiT 块、隐通道只增加 token,因此设计本身不含规模特定组件,扩展到更大预训练骨干主要是算力问题。对实践者而言,可直接借鉴的是两级反向链的组织方式、由变分下界导出的三项训练信号,以及推理时“隐去噪—token 读出—重新加噪”的交替采样循环。
仍待观察的是:层次耦合的收益在更大预训练骨干与更广任务上是否保持,论文把这一点列为最有前景的后续方向;隐序列长度存在一个经验上的最优容量(扫描中 4 最好,8 与 16 反而下降),其随任务与规模的变化规律尚不清楚;LM1B 上作者按 ELF 的做法不报告验证困惑度,因为流式模型的似然评估可能需要额外的似然专用训练;训练需要联合优化编码器、连续去噪器与 token 预测器,单步训练成本高于纯离散掩码扩散基线,这一开销只限于训练阶段。此外,本总结依据的是论文全文文本,正文中的公式与表格以文本形式呈现,个别数值的排版细节需以原文为准。
