跳到主要内容
返回时间线
arXiv来源发表:

免训练方法 SFT-as-context 让父模型以 SFT 回答为上下文,在 19 对模型、11 个基准上同时保住微调增益与通用能力

核心概要

该工作提出免训练的 SFT-as-context:推理时先让监督微调(SFT)模型生成回答,再让父模型把该回答作为上下文生成最终答案,从而通过上下文学习获取微调能力并保留自身通用能力;在 19 对父-SFT 模型与 11 个基准上,它在微调能力上接近 SFT 模型(AIME 2024 与 LiveCodeBench 差距仅 2.2 与 2.1 个百分点,NutriBench-English 宏 MAE 差 2.0),在通用能力上平均与父模型相差 2.2 个百分点以内,并能回答父模型与 SFT 模型单独都答不对的、同时需要两类能力的查询。

Source-provided article image: SFT-as-Context Mitigates Forgetting in Supervised Fine-Tuning
Figure 1 ·

Figure 1: SFT-as-context recovers both fine-tuned and general capabilities. The task is to predict the nutritional values (carbohydrates, fat, protein, and energy) from a meal description, in the same language as the given query. Only the carbohydrate value is shown here as an example. Subfigure (a) shows that an SFT model trained on English data excels in fine-tuned capability. However, subfigures (b) and (c) show that it fails at acknowledging non-food queries and responding in the same language as the query. When a query requires both fine-tuned nutrition estimation capability and general multilingual capability, only SFT-as-context satisfies both requirements. Subfigure (d) shows that the parent model attends more to useful English SFT responses than to hallucinated SFT responses to non-food queries, suggesting that selective attention helps the parent model use the SFT response through in-context learning. We discuss details of the attention analysis in Section 4.2 .

arXiv

深度剖析

SFT-as-context 是一种免训练、仅依赖文本输入输出接口的推理时方法:第一遍由 SFT 模型生成回答,第二遍把原始查询、该回答与固定的 SFT-as-context 指令一起交给父模型生成最终答案。 既有缓解遗忘的方法多需改动微调过程(正则化、回放、参数更新约束、更换训练方法),无法直接用于 Hugging Face 上现成的检查点;该方法不改动训练,也不需要模型权重或微调过程,因而可用于闭源模型。 方法描述与提示词在正文与附录 B.2 中给出;作者报告在 19 对父-SFT 模型、11 个基准上评估,并给出回退条件(如 SFT 回答耗尽预算或病态重复时改用父模型单独作答),MathIF 回退率为 3.73%(10,080 条中的 376 条)。

SFT 会显著损害通用能力:通用能力得分平均下降 33.2 个百分点,例如 Qwen3-8B 营养模型对非食物查询的识别从 99.6% 降至 10.7%;而 SFT-as-context 在保留微调增益的同时把通用能力拉回接近父模型水平。 作者用“恢复率”量化:SFT-as-context 平均保留 92.0% 的微调增益,并恢复 94.2% 的通用能力差距;在 AIME 2024 与 LiveCodeBench 上恢复率分别为 95.0% 与 94.1%。 结果以父模型、SFT 模型、SFT-as-context 三方在同一基准上的对照表呈现,覆盖数学、代码、营养三类任务与多个通用能力基准(IFEval、MGSM、SQuAD2.0、FQuAD2.0、CoQA、ACPBench)。

SFT-as-context 能在同一条回答中同时满足微调能力与通用能力要求,这是父模型或 SFT 模型单独都做不到的;在 MathIF、LiveCodeBenchIF、NutriBench-Non-English 上,它甚至优于在父模型与 SFT 回答之间做“神谕”选择的路由器。 以往把父模型与微调模型在推理时结合的做法(如 EFT、Proxy-Tuning)依赖 token 级概率或 logits,且不专门针对遗忘;路由方案每条查询最终只由一个模型作答,无法同时满足两类要求。 联合成功率对比显示 SFT-as-context 在 MathIF 上平均 30.7 对神谕路由 27.2,在 LiveCodeBenchIF 上 20.7 对 18.7;NutriBench-Non-English 上营养估计恢复率 84.6%、语言一致性恢复率 95.2%。

作者用上下文学习的贝叶斯框架给出误差界:在若干假设下,域内查询上 SFT-as-context 的误差小于父模型且接近 SFT 模型,域外查询上其误差与父模型之差有上界;注意力分析显示父模型对有用 SFT 回答的注意力份额高于无关回答(37.44% 对 15.11%,平均差 22.33 个百分点)。 这为“父模型通过选择性注意从 SFT 回答中获取微调能力、同时保留通用能力”提供了理论刻画与机制层面的经验证据,而不只是性能报告。 定理与证明见附录 K,依赖域后验界、输出可分性、域内可实现性与域外后验保持等假设;注意力分析在 Gemma-4-E4B-it 与其 SFT 版本上各随机抽取 100 条营养查询与非食物查询,对回答 token、层与注意力头取平均。

启示与展望

该方法面向已经存在父模型与 SFT 检查点的部署场景:只要具备标准文本输入输出接口即可使用,因此适用于闭源模型,也可让非父模型的更强模型充当最终生成者。作者报告其收益覆盖数学推理、代码与营养估计三类微调任务,以及指令遵循、多语言、问答与规划等通用能力;在需要同时满足两类能力的查询上,它把两种能力合并进同一条回答。开销方面,数学与代码任务第二遍生成的 token 数最多为第一遍的 13.0%,营养任务第二遍回答更长但绝对量仍在数百到一千余 token。作者也指出,同一框架原则上可扩展到 SFT 之外的后训练方法(如强化学习),并把这列为未来方向。

读者仍需留意若干开放问题。理论结果依赖一组显式假设(域后验界、输出可分性、域内可实现性、域外后验保持),这些条件在真实模型上是否普遍成立,文本未给出验证。注意力分析只在 Gemma-4-E4B-it 一对模型、每类 100 条查询上进行,其结论是否推广到其他规模与家族尚待检验。安全案例显示,当微调能力与通用能力直接冲突时,SFT-as-context 会跟随微调能力(HarmBench 上平均恢复率 16.44),作者把“如何优化指令以优先恢复特定通用能力”留作未来工作。此外,营养任务第二遍回答明显长于第一遍(NutriBench-English 比率为 198.1%),在延迟敏感场景下的代价需要按任务评估;作者也报告 RL 后训练本身遗忘很小,因此未在该设定上应用本方法。

来源