OASIS把自蒸馏监督限制在已验证轨迹上,在Qwen3-1.7B/4B/8B上把对OPSD的平均提升从0.59分扩大到3.05分
核心概要
该工作通过截断续写实验发现,在策略自蒸馏(OPSD)中教师相对学生的优势主要集中在学生答错的轨迹上(1.7B时77%对37%),且这一优势随模型规模增大而缩小,于是提出OASIS:保持OPSD目标不变,只把监督限制在最终答案通过验证的最短在策略轨迹上,并用同题的另一条自生成轨迹(通常是学生自己的失败尝试)替代书面参考解作为教师上下文,在Qwen3-1.7B、4B、8B上于AIME 2024、AIME 2025、HMMT 2025的平均Avg@12上分别比OPSD高0.59、1.86、3.05分,同时不再需要书面解答。
深度剖析
论文把标准OPSD中耦合的两个角色拆开:轨迹脚手架决定哪些前缀接受监督,教师上下文决定这些前缀上的目标分布,并用信号回放与恢复探针分别测量二者。 此前对OPSD的分析多从教师一侧入手,例如把教师信号分解为参考解诱导成分与仅依赖问题的成分,或证明为另一道题写的参考解仍能提供监督;该工作转而追问监督施加在学生轨迹的哪些位置上。 在Qwen3-1.7B与4B上,用冻结初始策略做纯推理探针,每个单元200条脚手架,报告95%自助法区间;恢复探针在截断前缀上以温度采样四条续写,按最后框选答案是否匹配真值判定恢复。
教师优势高度集中在失败轨迹:1.7B时金标上下文教师在失败前缀上恢复正确答案的比例为77%,学生单独为37%,空参考与无关参考分别为37%和32%;在已验证前缀上差距很小(99%对95%)。 这给出了一个可测量的判据:教师信号的价值取决于它能否从学生可见的上下文复现,而不是取决于参考解本身是否标准。 表1按前缀类型与上下文条件列出恢复率;失败前缀上仅给最终答案得61%,去掉答案的书面推理得51%,说明答案与推理都有贡献,且二者在推理时都不可得。
OASIS保持OPSD的损失、教师、提示、裁剪常数、温度与优化器不变,只改变被监督轨迹的分布:对每题采样若干条轨迹并验证最终答案,沿最短的已验证轨迹施加损失,教师上下文取同题的另一条轨迹,通常是一条未通过验证的尝试。 与拒绝采样微调不同,已验证轨迹不是训练目标,教师分布才是;方法只需要每题的最终答案,不需要书面解答。 在Qwen3-1.7B、4B、8B上,OASIS相对OPSD的平均提升为0.59、1.86、3.05分,相对基座模型的提升为3.64、3.84、3.19分,而OPSD相对基座的提升从3.05降到1.98再降到0.14;1.7B处0.59分的差距落在30题采样波动可产生的范围内,作者明确说明其单独不具结论性。
训练预算对比显示,OASIS在4B与8B上以约四分之一的被监督问题数、且不使用书面解答,达到或超过OPSD与AVSD的平均成绩,代价是生成量大幅上升。 这把OPSD对书面解答的依赖换成对可验证答案与更多采样的依赖,从而可扩展到只有可检验答案的数据集。 表4中OASD与AVSD各见12.8K题并全部训练,OASIS见6.4K题、实际训练约3.2K题、生成51.2K条轨迹;1.7B下OASIS生成43.5M token、监督1.98M token,OPSD生成2.76M、监督2.76M,已验证脚手架平均603 token对859 token。
启示与展望
该结果面向的是训练数学推理模型、且每个训练问题只有可验证最终答案而没有书面解答的场景;方法在Qwen3-1.7B、4B、8B与AIME 2024、AIME 2025、HMMT 2025上验证,作者把扩展到代码单元测试等廉价结果验证场景列为自然的下一步。对使用者而言,这意味着可以用采样与验证替代书面解答的标注,但需要接受更高的生成开销:OASIS 每题采样八条轨迹,1.7B下100步生成43.5M token,而OPSD为2.76M;作者也提到在生成成为瓶颈时,附录中的消融可把这一成本减半。
教师优势随规模缩小这一现象在更大模型上会如何演变,文本只给到8B;1.7B处OASIS与OPSD的0.59分差距落在采样波动范围内,作者也说明其单独不具结论性;4B与8B为单次训练运行,虽然表3用三个评测种子说明评测波动小于方法差距,但训练层面的波动仍待更多重复确认。裁剪分析指出逐词表项裁剪会移除教师对被裁剪词的上拉并反转其梯度符号,作者把它列为训练后期漂移的一种可能解释,并建议更大的阈值或改为按 token 裁剪散度,这一改动是否改变结论仍是开放问题。此外,验证器并不完美,未通过验证的轨迹更准确的描述是未被验证为正确,而非必然错误。
