跳到主要内容
返回时间线
arXiv来源发表:

ELF-REG 把连续扩散语言模型推到数学推理与代码生成:GSM8K 达 55.96% pass@1,MATH-500 从 10.55% 提升到 13.39%

核心概要

该工作将 Embedded Language Flows(ELF)扩展到数学推理与代码生成任务,提出 ELF-REG,用冻结的自回归教师模型监督中间去噪特征并提供与响应联合去噪的全局表示(REPA+REG),在 GSM8K、MATH-500、HumanEval、MBPP 上评估:ELF-REG-L 在 64 NFE 下 GSM8K pass@1 为 55.96%,在 128 NFE 下 MATH-500 为 13.39%、HumanEval 为 22.56%,在 GSM8K 与代码任务上超过所评估的同规模 dLM,并把 MATH-500 从 ELF-L 基线的 10.55% 提升到 13.39%;同一任务专用检查点无需少步训练即可通过 early-stop 在

Source-provided article image: ELF-REG: Scaling Continuous Diffusion Language Models to Reasoning Tasks
Figure 1 ·

Figure 1: ELF-REG improves generation with fewer task-training tokens. (a) A frozen AR teacher supervises intermediate features through REPA and a global REG token denoised jointly with the response. (b,c) ELF-REG-L and ELF-REG-B with early-stop ( ρ = 8 \rho=8 ) show superior performance across NFE, compared with PlaidQ [ Peng et al., 2026b ] , FMLM+ [ Agarwal et al., 2026 ] , S-FLM [ Deschenaux & Gulcehre, 2026 ] , and DBTM [ Tang & Wang, 2026 ] . Code uses pass@10 on MBPP-378; GSM8K uses mean pass@1. (d) Non-padding training token budgets. Appendix B gives more details regarding benchmark mappings, model sizes, NFE accounting, budget estimates, and evaluation differences.

arXiv

深度剖析

提出 ELF-REG,通过表示对齐与纠缠(REPA+REG)改进连续扩散语言模型的学习:冻结的 AR 教师监督中间去噪器特征,并提供一个与响应联合去噪的全局表示。 相对于此前的 ELF 基线,新增了教师监督中间特征与全局表示联合去噪两项机制,把连续 dLM 的训练从纯自监督去噪扩展到借助 AR 教师表示引导。 在 GSM8K、MATH-500、HumanEval、MBPP 四个基准上以 pass@1/pass@10 报告结果,并与所评估的同规模 dLM 对比;MATH-500 上从 ELF-L 的 10.55% 提升到 ELF-REG-L 的 13.39% 提供了直接的基线对照。

ELF-REG-L 在数学推理与代码生成上取得具体成绩:64 NFE 下 GSM8K pass@1 为 55.96%,128 NFE 下 MATH-500 为 13.39%、HumanEval 为 22.56%。 此前连续 dLM 在困难推理任务上的表现不如 AR LLM 与掩码 dLM,该结果把连续 dLM 的评估范围扩展到数学推理与代码生成并给出可比数字。 结果以 pass@1 在四个命名基准上报告,并注明对应 NFE;文中称其在 GSM8K 与代码任务上超过所评估的同规模 dLM。

无需少步训练,同一任务专用检查点即可通过 early-stop 在低 NFE 下取得较好表现:early-stop 解码中间干净预测而不走完整个去噪轨迹;16 NFE 时 ELF-REG-L 的 HumanEval pass@10 为 41.21%。 把低 NFE 推理能力与少步训练解耦,说明同一检查点可同时服务高 NFE 与低 NFE 场景。 以 16 NFE 下 HumanEval pass@10 为 41.21% 的具体数值支撑,并与近期同规模连续 dLM 对比。

启示与展望

该结果面向研究连续扩散语言模型在推理任务上能力的研究者与工程团队,适用场景为数学推理(GSM8K、MATH-500)与代码生成(HumanEval、MBPP)的基准评估,以及需要在低 NFE 下并行解码的推理部署。方法以冻结 AR 教师和任务专用检查点为前提,因此其结论适用于这些任务与所评估的规模范围;early-stop 的发现为同一检查点在低 NFE 下的使用提供了路径。

所读为摘要,未包含消融实验、训练规模、教师模型选择与统计显著性等信息,因此 REPA 与 REG 各自贡献多少、结果对教师与检查点的敏感度如何,仍是需要看正文才能回答的问题。此外,MATH-500 与 HumanEval 的绝对分数相对 GSM8K 明显偏低,说明困难推理任务上连续 dLM 与 AR LLM 的差距是否已实质缩小,仍需更多任务与规模上的验证;MBPP 的具体结果在摘要中未给出数值。

来源