跨分词器在线蒸馏中,严格对齐已覆盖85.57–96.98%学生token,学生自选top-16子集保留至少96%增益,而补齐错配跨度监督反而降低准确率
核心概要
该研究在数学推理与代码生成上考察三组异构教师—学生模型对的跨分词器在线蒸馏,发现尽管静态词表Jaccard重叠仅39.49–64.87%,严格对齐组已覆盖85.57–96.98%的学生token,共享词表在严格位置保留近乎全部预测概率质量;将反向KL限制在学生自选的共享词表top-16子集即可保留全共享词表蒸馏至少96%的平均提升,而用跨度对数概率MSE补齐错配组虽实现完全监督覆盖,却在全部18个正权重设置下降低准确率。
深度剖析
严格对齐在学生自生成轨迹上已覆盖大部分token,静态词表重叠低估了可比较的监督范围。 此前跨分词器蒸馏多从扩大对齐覆盖入手;本文用动态覆盖率而非静态词表重叠来刻画可监督范围,并给出三组模型对的完整运行与三个不重叠窗口统计。 三组教师—学生模型对(Qwen→Llama、Granite→Phi、Granite→Qwen)各100次迭代、每次512条rollout,共51,200条响应;学生token覆盖率85.57–96.98%,教师token覆盖率82.82–97.26%,窗口间波动分别不超过1.43与3.75个百分点。
共享词表在严格位置承载了几乎全部预测概率质量,且学生自选top-16子集同时保留双方大部分质量。 把“词表不匹配”与“概率质量分布”区分开:静态不匹配并不决定共享词表保留多少概率质量,且仅用学生分布选出的子集也能覆盖教师质量。 在蒸馏前学生生成的完整20k提示上测量;共享词表平均保留教师99.69–99.90%、学生98.99–99.81%的质量;top-16保留教师至少93.54%、学生至少94.55%;子集从16扩到128,教师质量增益至多3.44个百分点、学生至多2.70个百分点。
把反向KL限制在学生自选top-16子集可保留全共享词表蒸馏的大部分学习收益,且三个严格变体在数学与代码平均上均高于所评估的跨分词器基线。 表明在异构分词器下,集中式监督仍然足够,无需为追求覆盖而引入更宽的监督集合;top-16在全平均上领先最强替代方法0.51–1.05个百分点。 三组模型对在MATH500、GSM8K、AIME-2024/2025/2026、AMC23、Minerva-Math与HumanEval、MBPP、LiveCodeBench上评估,数学mean@32、代码mean@8;top-16保留Base到严格全词表全平均提升的至少96%;附录D中235B教师到8B学生的实验里top-16取得最高数学、代码与全平均,附录E的ALFWorld上top-16在seen与unseen划分均取得最高成功率。
对错配组施加跨度对数概率MSE虽实现100%结构监督覆盖,却一致降低下游准确率,梯度诊断给出一种解释。 把“覆盖”与“监督可靠性”作为两个可分别测量的量:新增监督的价值取决于其与严格分布匹配的相互作用,而非覆盖了多少位置。 18个正权重设置全部低于各自严格基线0.27–1.20个百分点;在仅用严格损失训练的step 0/20/60/100检查点上,跨度梯度与严格梯度的方向一致性弱或为负,且始终低于把严格位置随机二分得到的参考一致性,跨度与严格梯度范数比随检查点上升。
启示与展望
该结果面向使用异构分词器进行在线蒸馏的实践者:当教师与学生词表不同、但学生轨迹上存在大量严格对齐位置时,可优先在严格位置施加反向KL,并把支持集压缩到学生自选的共享词表top-16子集。适用设定为本文考察的数学推理与代码生成,以及附录中的更大教师与ALFWorld具身任务;训练采用100次在线迭代、每提示一条响应、反向KL、温度1.0,评估为数学mean@32与代码mean@8。
跨度梯度与严格梯度的弱方向一致性、以及跨度梯度范数相对上升,是作者用来解释准确率下降的诊断,而非因果证明;这一解释在更大教师与ALFWorld设定下是否同样成立,原文未给出对应梯度分析。概率质量测量基于蒸馏前学生的一次rollout,并排除了空响应、字节流不一致、无可评分严格位置及超长输入等样本,因此保留质量数值对应的是可评分严格位置上的平均。top-16与top-128之间没有一致增益,最优子集大小是否随模型对或任务变化仍待考察。此外,本文以数学与代码为主,其他领域与更长生成设定下的表现尚不清楚。
