ROSS 把训练中丢弃的历史自生成轨迹重新利用,在 Qwen3.6-35B-A3B 上把 MOPD 六基准均值从 58.40% 提到 62.20%、SWE-bench Verified 从 64.20% 提到 68.40%
核心概要
ROSS 提出一种选择性监督的再学习流程:从原始 RL、多教师在线蒸馏(MOPD)或智能体 RL 训练中保存的历史自生成轨迹里,先用结果验证器筛出成功轨迹,再由 LLM 审阅者标出值得模仿的模型生成片段,保留完整轨迹作为上下文但只对被选中的 token 施加损失,从而在不产生新 rollout 的离线 SFT 阶段提升上游检查点,在 Qwen3.6-35B-A3B 上把 MOPD 六基准平均从 58.40% 提升到 62.20%、SWE-bench Verified 从 64.20% 提升到 68.40%。
深度剖析
论文把历史自生成 rollout 确立为可复用的训练经验来源,而不是策略推进后即被丢弃的过期产物。 此前 RFT、RAFT、ReST-MCTS*、RLoop、RIFT 等方法大多把一条 rollout 当作不可分割的监督单元,按整体结果或奖励来筛选、精炼或重加权;ROSS 则把问题拆成两层——哪些历史 rollout 值得回看,以及其中哪些片段值得学习。 论文给出两项预备分析:在 100 道数学题上,历史 rollout 在当前策略下的 token 级 NLL 明显低于外部教师 GLM-5.2 的回答,且接近当前策略自身的 rollout;在历史曾解出的最难训练题上,当前策略仍能解出这些题,但平均成功率较低,说明这些行为仍在策略的行为支撑内却未被可靠表达。
ROSS 用“完整上下文 + 选择性目标”的掩码式教师强制目标,只对经审阅确认的模型生成片段计算损失。 与对整个成功轨迹做 SFT 的 Positive-Rollout SFT 不同,ROSS 保留原始前缀(包括此前的错误、被放弃的尝试和环境反馈),但把确认的错误、冗余探索等片段从损失中移除;单轮回答用正片段抽取,智能体历史用缺陷定位,两者最终都编译成同一个 token 级掩码。 方法由结果验证器做轨迹级筛选、LLM 审阅者做片段级标注,再由确定性检查保证源文本一致与 token 对齐;候选若无法在不保留已确认错误、不引入缺失推理的前提下恢复出有效目标,则被拒绝。
在领域 RL、MOPD 与智能体 RL 三类设置中,ROSS 都优于上游检查点和再学习基线,并且增益可分解为轨迹筛选与 token 级掩码两部分。 论文用三组顺序对照(replay、filtering、masking)把增益拆开:仅做轨迹筛选的 ROSS w/o mask 已把 MOPD 平均从 57.70 提到 58.49、略高于上游;在固定回放集后,完整 ROSS 再比 ROSS w/o mask 提高 MOPD 3.71 分、LCB Gen 1.91 分、OJBench 0.43 分、Math 0.66 分。 领域 RL 下 Math 平均从 75.19 升到 76.98、Code 平均从 42.09 升到 44.21;MOPD 六基准平均从 58.40 升到 62.20;智能体设置下 SWE-bench Verified 从 64.20 升到 68.40,比上游高 4.20 分。
历史轨迹的价值不依赖继承上游参数,且被排除的监督在 RL 推进过程中并未自然消失。 用相同的历史轨迹、监督掩码和 SFT 配置分别从 Base 和 Upstream 初始化,Base 初始化的 ROSS 在各评测设置上与 Upstream 初始化相当,说明这些经验可以迁移到不同初始化;同时被排除内容的语义构成随领域不同,数学中“错误后可见纠正”在早期和晚期样本中都占主导,代码中“冗余探索”占比从早期到晚期上升。 token 加权目标排除率(TER)在数学中从早期到晚期仅小幅下降,在代码中反而上升;附录 H 的 4B 数学运行中,上游检查点出现重复输出答案的模式,ROSS 把重复率从 84.5% 降到 21.5%、平均 boxed 答案数从 628.3 降到 63.0,同时把 Avg. Math 从 52.05 提到 63.65。
启示与展望
这项工作面向已经完成一轮自生成训练、并保存了检查点与 rollout 的后训练流程,适用于数学、代码生成、指令跟随和软件工程等有结果验证器可用的任务;ROSS 作为额外的离线 SFT 阶段接在领域 RL、MOPD 或智能体 RL 之后,需要 LLM 审阅者完成片段标注,并依赖确定性检查保证源文本与 token 对齐。对希望在不重新采样 rollout 的情况下继续榨取已有训练经验、或想把某次训练中发现的行为迁移到另一初始化的团队,这条路径提供了可操作的参考;智能体场景还要求保留完整交互历史并采用更长的上下文预算。
片段级标注依赖 LLM 审阅者的判断,论文用独立审阅与确定性边界检查来约束它,但审阅者在不同任务分布上的稳定性仍是读者会关注的问题;被排除内容的分类基于抽样轨迹,覆盖的是所观察运行的两个窗口而非完整训练过程;跨域结果中代码 ROSS 在 AIME 2025 上有所下降,而数学 ROSS 在跨域基准上不及完整回放的 Positive-Rollout SFT,这些差异提示增益的分布会随设置变化;此外,4B 数学运行的重复输出抑制来自单独的附录实验,其结论向更大模型与其它领域的推广仍需更多证据。
