跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

arXiv

OG-OPSD 用结果正确性选择 KL 方向并按熵截断前缀,在 Qwen3 1.7B/4B/8B 上把数学推理平均分提升至 44.4/64.9/66.4

该工作从 RLVR 的优势视角分析在线自蒸馏(OPSD),发现固定散度目标对错误轨迹惩罚不足、奖励过度,且教师监督可靠性随轨迹结果与累积平均教师熵变化,于是提出 OG-OPSD:对正确轨迹全程用前向 KL、对错误轨迹仅在由累积平均教师熵最后一次交叉点确定的前缀内用反向 KL;在 Qwen3-1.7B/4B/8B 与 Qwen3-VL-2B 上,该方法在数学推理、多模态推理与分布外任务中一致优于 vanilla OPSD 与多个强基线。