跳到主要内容
返回时间线
arXiv来源发表:

SFT也能泛化:把更新方向锁到同一条线上,训练时间减半还超过GRPO

导语

把监督微调的参数更新限制在在线策略训练给出的方向上,SFT的泛化能力追平GRPO,训练时间还减少一半以上。

Source-provided article image: On-Policy Parameter Update Direction Underlies Generalization in LLM Post-Training
arxiv.org

正文

监督微调(SFT,用固定标准答案优化模型)的泛化能力可以靠一个方向约束补上,不必改动它的训练目标。 此前认为SFT只会记忆、强化学习才会泛化,改进SFT的做法多集中在数据筛选、损失加权或加入负样本上。 在Qwen3-1.7B/4B/8B与DeepSeek-R1-Distill-Llama-3-8B上,约束方向的OPSFT在数学与代码基准上稳定超过原始SFT,并达到提供该方向的GRPO的水平。

做法是先跑少量在线策略训练,记下每个参数累计更新的符号,再让SFT的梯度只保留与这些符号一致的分量。 此前只利用在线策略更新的位置(哪些参数被更新),把位置当作训练的副产物。 只约束更新位置的版本甚至差于原始SFT,而把约束从位置扩展到方向后泛化大幅提升,说明方向而非位置在起作用。

方向约束还让SFT能继续吸收新得到的高质量轨迹,而不破坏在线策略训练已获得的能力。 直接把高质量轨迹做SFT会让后训练模型掉分,例如Qwen3-4B平均准确率从38.96降到36.25。 沿原在线策略方向继续训练后,同一模型平均准确率升到41.36,代码任务上结果一致。

接下来

想复用这一结论的研究者,可以先在目标域跑少量在线策略步骤取出累计更新符号,再用它约束SFT,从而在数学或代码这类可验证任务上以更短训练时间获得接近在线策略的泛化。做后训练流水线的工程团队可以把这一方向约束接到已有SFT代码上,用于继续吸收新采集的高质量轨迹,而不必从基座模型重跑整个SFT加强化学习流程。

方向约束在多大程度上依赖轨迹质量仍待厘清:实验使用的是明显强于被训练模型的教师模型生成的推理轨迹,而在线策略范式实际训练时用的是当前策略自己生成的轨迹,两者在多样性、正确性和适配性上可能不同。现有衡量推理轨迹质量与适配性的研究有限,因此轨迹性质如何影响所得到的方向与OPSFT表现,是后续值得跟踪的问题。

来源