前向KL被证明会把学生模型熵抬到教师之上,蒸馏中的散度因此充当隐式熵正则器
相关研究与后续进展核心概要
该工作从熵的视角研究知识蒸馏,证明前向KL会使学生模型熵高于教师模型,而交叉熵训练作为其特例给出一个可在预训练与监督微调中定量验证的恒等式;反向KL则压低熵直至学生与教师差距过大,两者之间插值在训练早期平滑改变熵、在收敛时突变;在线蒸馏的低熵来自词元级反向KL而非在线采样,散度因此充当隐式熵正则器,在自蒸馏中通过补偿特权信息条件化带来的熵收缩而体现其作用。
Figure 1: Decoupling divergence from sampling in distillation. A prompt x x is completed by the sampling distribution p p , and the student π θ \pi_{\theta} is then compared to the teacher π ∗ \pi^{*} on each token of the completion through a divergence ℓ \ell between their next-token distributions. Writing the objective at the token level keeps the two choices independent, whereas a sequence-level divergence ties them together. Details in Section 2 .
arXiv深度剖析
论文证明前向KL会使学生模型的熵被抬升到教师模型之上,并指出交叉熵训练是这一情形的特例,从而得到一个关于熵的恒等式。 此前蒸馏的性质尚未被充分理解,该工作把蒸馏目标中的散度选择与学生的熵水平直接联系起来,并给出可验证的定量关系,而非仅作经验观察。 证据来自形式化证明,并在预训练与监督微调两种设定下对该恒等式做了定量验证。
其他散度不带有这种保证:反向KL会压低学生熵,直到学生与教师之间的差距变得过大;在前向与反向KL之间插值时,熵在训练早期平滑变化,但在收敛时出现突变。 这补充了前向KL结论的另一侧,说明熵行为并非所有散度共有,而是取决于所选散度,并刻画了插值路径上熵随训练进程的不同表现。 证据为理论层面的散度分析,配合对训练早期与收敛阶段熵变化形态的描述。
在线蒸馏所表现出的较低熵来自词元级反向KL,而不是来自在线采样本身。 这纠正了对在线蒸馏低熵来源的直觉归因,把原因定位到目标函数中的词元级反向KL项。 证据为对在线蒸馏熵来源的分解性分析,将采样方式与散度形式区分开。
散度因此充当隐式熵正则器,其作用在自蒸馏中最为清晰:当对特权信息的条件化压低熵时,表现最好的散度超参数正是那些能补偿这一熵收缩的取值。 该工作把散度从单纯的目标函数选择提升为可调节熵的机制,并给出自蒸馏中散度超参数与特权信息条件化之间相互补偿的解释。 证据来自自蒸馏情形下散度超参数与特权信息条件化所致熵收缩之间关系的分析。
启示与展望
该结果面向使用蒸馏训练大语言模型的研究者与工程师,适用于以散度定义蒸馏目标、并关心学生模型熵水平的设定,包括预训练、监督微调、在线蒸馏与自蒸馏。它给出的是一套关于散度如何影响熵的判据:前向KL抬高熵、反向KL压低熵、插值在早期平滑而在收敛时突变,以及自蒸馏中散度超参数可补偿特权信息条件化带来的熵收缩。据此,读者可以在选择蒸馏目标与调参时把散度视为隐式熵正则器,而不是仅当作拟合目标的距离度量。
文本仅呈现摘要层面的信息,未给出证明的具体形式、恒等式的表达式、预训练与监督微调实验的规模与设置,也未说明插值突变发生的具体条件与自蒸馏中超参数的具体取值。读者若需要判断这些结论在自身模型规模与数据分布下的适用程度,仍需查阅正文中的推导与实验细节。
