跳到主要内容
返回时间线
arXiv来源发表:

GRAFT让两个异构模型互换轨迹:同预算下双双超过GRPO,平均提升2.1分

核心概要

该工作提出GRAFT框架,在可验证奖励强化学习(RLVR)中把接收方全部失败的rollout组替换为同伴模型同时含成功与失败回答的组,并用序列级兼容性加权与token级重要性比率裁剪控制跨模型失配;在三对异构模型和五个数学推理基准上,GRAFT在相同单模型rollout预算下同时提升两个模型,平均提升2.1分、最高4.5分,且复用已存储的同伴轨迹仍平均提升1.8分。

AI-generated editorial illustration: Learning Beyond What You Sample: Off-Policy-Aware Cross-Model Trajectory Exchange for RLVR

深度剖析

GRAFT把RLVR中“全失败组无梯度信号”的问题转化为跨模型互补问题:当接收方某提示的整组rollout全部失败、而同伴在该提示上既有成功也有失败回答时,用同伴的整组回答替换接收方的失败组,并保留同伴自己计算的组内相对优势。 此前GRPO类方法只能依赖自身探索,动态采样丢弃零方差组、增大组规模或重塑奖励都仍受限于学习者自己的采样;HACPO在更广范围共享同伴rollout,SGT只迁移已验证的同伴成功样本并用固定权重监督损失。GRAFT把“选哪些提示”和“如何在这些提示上学习”作为一对相互作用的决策同时处理。 论文报告在SmolLM3-3B-Base与Qwen3-1.7B-Base的独立GRPO运行中观察到互补性:SmolLM3-3B-Base解决了Qwen3-1.7B-Base八次rollout全部失败的提示中的47.9%,反向为18.7%;主实验覆盖三对异构模型与五个数学基准,每个检查点五次评测、每题八个样本,并报告均值与标准差。

GRAFT用两层机制控制跨模型失配:序列级兼容性门控根据平均token对数似然给出有界权重并设下限阈值,token级重要性比率裁剪则只跟踪接收方自身在优化中的变化,同伴回答按接收方分词器重新分词后进入同一目标函数。 论文把字符串级似然比分解为“接收方优化中的变化”与“与同伴的初始失配”两部分,前者用token级PPO代理处理,后者用序列级兼容性权重处理;作者明确指出兼容性分数是平均token对数似然得到的经验代理,而非精确的跨分词器密度比。 消融显示,去掉兼容性门控使SmolLM3-3B-Base平均分下降8.36分、Qwen3-1.7B-Base下降2.51分;去掉下限阈值使Qwen3下降3.56分;把token级比率换成序列级比率也降低表现。阈值扫描中0.5在两个接收方上取得最高平均分。

同伴小批次的处理顺序本身构成一种控制手段:把含同伴组的小批次放在接收方自身在策略小批次之后,使token级裁剪在同伴token上真正被激活。 论文指出在新收集的rollout批次第一次优化前重要性比率为1,若先处理同伴小批次则其贡献不会被裁剪,只剩序列级权重约束失配;peer-last排序让接收方自身数据优先,并把裁剪变成第二重调节机制。 附录H统计训练前48步中被裁剪token比例:peer-last在同伴token上为0.28%–0.44%,uniform为0.13%–0.25%,peer-first低于0.01%;peer-first下97.6%的步数对同伴token零裁剪,peer-last为0.0%。消融中peer-last平均分高于peer-first与uniform。

收益不严格依赖同步协同训练:使用同伴在独立GRPO运行中已存储的回答与生成对数概率,重新验证奖励后套用同样的选择、加权与更新规则,六个模型块全部优于GRPO,平均提升1.8分,约为在线交换2.1分的84%。 在线协同训练需要同时驻留两个模型及其优化器状态;存储轨迹版本说明跨模型探索的收益可以在不加载、不训练同伴模型的情况下大部分保留,尽管此时单向迁移使平衡交换机制失效。 存储轨迹实验在六个模型块上提升0.80–2.68分;Pair 1中获取两个选定接收方检查点需23.2 GPU小时(不含此前用于收集同伴日志的GRPO运行),在线GRAFT为40.9 GPU小时。三对模型各重复三次独立训练,GRAFT在全部六个模型块上平均聚合分高于GRPO。

启示与展望

该结果面向使用可验证奖励、以GRPO类方法做后训练的研究与工程场景,尤其是同时拥有多个异构开源基础模型、希望在不指定更强教师的前提下互相补足探索的团队。方法适用于两个模型成对训练:接收方整组失败且同伴组内既有成功也有失败时触发替换,兼容性阈值在Pair 1上选定后固定用于其余两对。对希望降低显存与调度成本的实践者,存储轨迹版本说明可以复用同伴独立GRPO运行留下的回答与对数概率,无需同时驻留两个模型。论文把收益归因于互补性本身,因此互补性越强的一对模型收益越大。

论文自身列出的范围限制值得读者留意:收益大小取决于两个模型的互补程度,在Pair 3上最小;跨分词器时兼容性分数只是代理而非密度比;研究只覆盖两个模型的配对、只做数学、只用不超过3B参数的基础模型。两个以上同伴的交换以及没有可验证奖励的领域被留作未来工作。此外,主表结果使用第一次训练运行,附录C的三次重复显示GRAFT在六个模型块上平均聚合分仍高于GRPO,但单次运行的波动幅度值得在复现时一并观察。本证据包为全文,包含主表、消融表、计算开销表与附录统计,因此上述判断基于论文报告的完整内容。

来源