跳到主要内容
返回时间线
arXiv来源发表:

EDR:把推测解码训练目标改为直接最小化期望解码轮数,在九个基准上提升 DSpark 与 DFly 的平均接受长度

核心概要

该工作把并行与半自回归推测解码草稿模型的训练建模为马尔可夫奖励过程,提出期望解码轮数(EDR)目标,用状态占用度加权局部拒绝代价,并给出精确的时序差分梯度与离线评估器;在九个数学、代码与对话基准上微调 DSpark 和 DFly 后,平均接受长度一致提升并优于端到端 TV 等既有目标。

AI-generated editorial illustration: Training Parallel Speculative Draft Models by Directly Minimizing Expected Decoding Rounds

深度剖析

论文将推测解码(在给定目标模型输出序列的条件下)表述为马尔可夫奖励过程:状态记录当前轮从何处开始以及正在验证哪个位置,每次拒绝记为一轮代价,并证明期望解码轮数等于对角状态占用度之和。 此前针对并行与半自回归草稿模型的训练目标依赖块内局部代理量,忽略跨轮耦合;该框架把跨轮依赖显式纳入,并给出期望轮数的精确刻画。 以命题与定理形式给出,并附有附录中的推导,包括占用度前向递推与拒绝-接受转移的贝叶斯推导。

提出 EDR 目标,其值精确等于期望解码轮数:把 EOS 感知的局部拒绝代价(草稿与目标分布之间的 TV 距离,排除 EOS 并按目标非 EOS 质量归一化)按状态占用度加权求和,且不引入额外超参数。 既有代理目标(如块内期望接受长度、手工权重的分布差异)不处理 EOS 终止且以启发式方式加权;EDR 使用草稿依赖的真实占用度,并证明逐轮最大化期望接受长度可严格次优。 定理 1 给出与期望轮数的等价性;定理 3 通过构造说明块内最优的第一阶草稿模型在全局 MAL 上可差一个常数因子。

推导出 EDR 的时序差分形式梯度,仅使用局部导数即可从目标模型 rollout 做无偏随机优化,并给出期望轮数与逐位置接受率的精确离线评估器,使多个草稿模型可在同一批目标 rollout 上做配对比较。 直接对占用度前向递推反向传播代价高昂;TD 形式把梯度分解为局部拒绝代价的即时影响与接受概率变化的下游影响(由价值差加权),训练更高效。 定理 2 给出梯度形式;离线估计量被说明为无偏(轮数)与一致(MAL、接受率),且评估不依赖草稿模型。

在 Qwen3-4B+DSpark 与 Qwen3-8B+DFly 两组配置上,仅微调草稿模型参数一个 epoch,EDR 在九个基准(GSM8K、MATH、AIME25、MBPP、HumanEval、LCB、MT-Bench、Alpaca、Arena-Hard)上的 MAL 均高于或等于 E2E 目标,并在 AIME25、LiveCodeBench 与对话基准上增益更大。 相对原始草稿模型与端到端 TV 块内目标,EDR 在不改动架构与推理流程的前提下取得一致提升,且跨两种半自回归草稿架构与两种目标模型规模成立。 所有方法在同一目标模型与采样配置下使用完全相同的目标轨迹做配对比较,消除了独立采样评估输出带来的方差;训练数据为 Open-PerfectBlend,每轨迹最多 512 个训练锚点。

启示与展望

该框架面向固定草稿块大小的并行与半自回归草稿模型,适用于以目标模型 rollout 为训练与评估基础的场景,例如在已有公开草稿检查点上做一 epoch 微调;离线评估器适用于在同一批目标轨迹上对多个草稿模型做配对比较。作者指出,在高并发服务下验证长草稿块可能低效,将框架扩展到自适应块大小并研究每轮动态选择最优块大小是后续方向。

EDR 需要为多个锚点位置计算占用度权重与价值函数,作者指出这比块内目标计算更昂贵,如何更高效地利用占用度与价值计算仍是开放问题。表 2 显示 MAL 在不同数据集间差异明显,作者表示当前工作未给出目标分布这一难度的完整理论刻画。此外,加载文本中若干公式、表格数值与超参数以占位形式呈现,若需复现具体数值与设置,应以原文公式与附录为准。

来源