跳到主要内容
返回时间线
arXiv来源发表:

用熵位移筛选蒸馏位置,让LLM评审在主观任务上比Dr. GRPO高出2–9个百分点

核心概要

该工作研究如何用自然语言反馈训练LLM评审,提出以教师与学生之间的逐位置熵位移来区分“语境锐化”和“语境扩散”两种机制,并据此遮蔽高熵位移位置,使自蒸馏评审在主观子类上比结果监督RL(Dr. GRPO)高出2–9个百分点,同时在客观子类上保持竞争力。

深度剖析

论文把逐位置熵位移定义为教师(额外条件于语言反馈)相对学生的下一词分布熵减少量,并据此区分两种机制:正位移的“语境锐化”让教师把概率集中到某个与反馈一致的准则表述上,负位移的“语境扩散”让教师把概率分散到多个与反馈一致的备选准则上。 此前结果监督RL(如GRPO、Dr. GRPO、DAPO)只用最终裁决正确性这一个标量给整个 rollout 的每个 token 记功,对准则选择位置没有单独信用,也丢弃了偏好标签天然附带的语言反馈;自蒸馏虽能提供逐位置监督,但默认所有位置同等有效。 在102条HelpSteer3-Preference验证 rollout、104,046个响应位置上分析,逐位置反向KL与熵位移呈U形关系,两端各约占总位置30%却携带约20–28倍于中间40%的逐位置KL;准则选择片段仅占16.7%的token却占44.4%的反向KL质量,准则名位置仅占0.4%的token却占11.1%的KL质量,且94.8%落在两个极端30%尾部。

作者提出按熵位移做位置遮蔽:在每个生成内部按熵位移排序,遮蔽最大的前70%,保留最低的30%,即优先保留“语境扩散”位置。 这是把上述两种机制的解读转化为一个简单、无需额外标注的逐生成掩码,遮蔽比例设为0即退化为朴素自蒸馏。 在Qwen3-4B-Instruct与Qwen3-30B-A3B-Instruct上做遮蔽比例扫描,30B上总平均从朴素SD的80.17升到82.50,4B上从77.70升到79.04;方向翻转、双尾、随机遮蔽、按学生熵遮蔽、按教师熵遮蔽五种对照在相同遮蔽比例下均低于该方法。

在主观子类上,两种自蒸馏变体都比Dr. GRPO高2–9个百分点,而在客观子类上Dr. GRPO保持竞争力。 这给出一个与“结果监督RL在客观任务上有效”互补的结论:当裁决取决于援引哪些准则及其权重时,来自语言反馈的稠密逐位置监督更有优势。 30B上Chat 74.07对76.74/80.53、Factuality 71.79对78.53/79.16、Focus 80.00对86.26/85.66;4B上Chat 68.91对75.71/77.95、Factuality 62.74对68.42/70.74、Focus 75.76对80.20/77.78;客观侧30B的RM-Bench Math为95.59(Dr. GRPO)对94.45/95.63,RewardBench v2 Math为87.43对81.42/84.15。

遮蔽高熵位移位置与更宽的准则多样性相关,并在下游成对选择中带来更高胜率。 论文把机制解释延伸到推理期行为与下游用途:SD+mask在每一个聚类阈值下都比朴素SD调用更多不同的准则簇,并在多轮best-of-eight锦标赛中选出更受下游评估偏好的回答。 准则多样性在RM-Bench、RewardBench v2、HelpSteer3-Preference各300个样本上测量,差异从阈值处的4个簇增至26个簇;创意写作胜率为Dr. GRPO 0.556、朴素SD 0.612、SD+mask 0.632。

启示与展望

该方法面向指令微调模型作为评审的训练场景,适用于偏好数据中每条样本都附带能点明决定性准则的一两句话理由的情形;作者也验证了用生成的评分细则作为反馈时遮蔽仍然有效,说明收益不限于一种反馈格式。对希望降低标注成本、直接复用偏好数据中已有理由的团队,这提供了一条无需额外标注的稠密监督路径;对需要通用评审覆盖多样提示的团队,准则多样性这一性质具有直接相关性。

作者自述两点范围限制:方法依赖反馈质量,当反馈未能点明决定性准则或只给泛泛指引时,熵位移遮蔽不保证有用监督;方法也未显式处理自蒸馏已知的幻觉与长链思维推理模型训练不稳定问题,作者把扩展到长链思维推理模型列为未来工作。此外,下游验证用的是多轮best-of-eight锦标赛而非完整GRPO策略更新,因此“作为奖励选择器更可靠”这一结论的适用范围仍需在完整RLHF流程中进一步确认。

来源