残差优势让教师只重分配步骤信用:24项对比全部提升,Co-RA再增1.0–1.5分
核心概要
作者提出残差优势(RA):把教师与学生的概率残差当作有界的一步奖励,减去学生策略下的状态价值形成优势,再在每条回答内中心化后加到验证器优势上,使验证器决定回答整体好坏、教师只在步骤间重分配信用;在Qwen3-1.7B/4B学生与Qwen3-8B教师上,RA配合GRPO或REINFORCE++在三个数学基准的24项三种子对比中全部提升,宏观Avg@8提高1.7–3.6分、Pass@8提高3.9–6.3分,均超过纯教师OPD;Co-RA用验证器优势在同一批学生数据上更新教师LoRA,再增1.0–1.5分Avg@8。
Figure 1: Local teacher guidance redistributes the verifier’s response-level credit. (a) At one prefix, the reward Q d ( s , v ) = q s ( v ) − p s ( v ) Q_{d}(s,v)=q_{s}(v)-p_{s}(v) over the student’s likeliest tokens, its value V d p ( s ) V_{d}^{p}(s) under the student policy, and the advantage A s d ( a ) A_{s}^{d}(a) of the sampled token, here the student’s third choice and the teacher’s first. (b) Labels along one response, with blue and coral stems for positive and negative guidance terms δ t \delta_{t} ; each label is A V A^{V} plus a centered guidance term, so the labels’ weighted mean is A V A^{V} .
arXiv深度剖析
RA把教师–学生概率残差作为有界的一步奖励,减去学生策略下该奖励的状态价值(学生价值基线)得到局部优势,再在每条回答内中心化后加到验证器优势上,因此引导项在每条回答内均值为零,验证器优势仍是该回答的平均标签。 与OPD使用对数比或散度坐标不同,RA直接比较被采样token与学生自己会考虑的其他候选(按学生概率加权),并显式移除教师的回答均值;作者证明该局部优势是学生向教师移动时平方距离的一阶下降率,其期望更新正是该距离的对数几率梯度,且被学生–教师距离乘以学生留给其他token的概率所界定。 命题1给出三条性质并在附录A.1证明;式(6)对每条回答成立,式(8)给出逐项与整体引导界;附录C.1记录固定权重下平均绝对引导从约某值降至约某值。
在Qwen3-1.7B-Base与Qwen3-4B-Base学生、Qwen3-8B教师、DAPO-Math-17K两轮训练下,RA加到GRPO或REINFORCE++上改善了全部24项三种子基准均值,宏观Avg@8提高1.7–3.6分、Pass@8提高3.9–6.3分,两种组合都超过纯教师OPD。 此前OPD与RLVR多作为两条独立范式或简单混合;这里在同一预算下把教师作为RL内的评论式信号,并在匹配预算下超过OPD后接REINFORCE++的顺序方案与联合加反向KL损失的方案。 表1给出两学生×两估计器×三基准的Avg@8与Pass@8,附录D给出三种子均值与样本SD;权重在训练提示的验证划分上选取,评测基准未参与选择。
Co-RA在每次迭代用基础估计器的验证器优势、在同一批已评分学生数据上更新教师LoRA,并用更新后的教师提供下一轮残差,在四个RA运行上再增1.0–1.5分宏观Avg@8,十二项基准均值全部上升。 与VPD等用结果监督精炼教师再蒸馏不同,Co-RA把基础估计器的裁剪更新直接施加到教师LoRA上,使教师适应学生自己的解题路径;适配器从零开始,故首次学生更新与RA一致。 表1与附录D.9显示每个适配后的教师自身得分比冻结教师低若干分,而它所引导的学生更好,说明它成为更好的引导者而非更好的解题者;覆盖率变化混合,Pass@8在四项上升、两项不变、六项下降。
消融显示学生价值基线与回答内中心化各自都有贡献,且概率残差优于对数比:去掉学生价值基线、去掉中心化、用原始残差或直接平方距离损失都会降低表现;把残差换成对数比也低于完整RA。 作者把残差与对数比放在同一Bregman族的两端,指出只有二次端点具有有界教师影响;并给出离线统计说明残差把59%的引导放在学生概率处于中间区间的12%token上,而对数比把50%放在教师概率极低的4%token上。 表2在权重5、10、20下比较各控制;表3比较对数比变体;附录C.2在256条离线回答、176,628个token上统计引导落点;附录C.3比较采样标签与直接损失的更新份额。
启示与展望
该结果面向用可验证奖励后训练推理模型的研究者与工程师,适用于学生与教师共享词表、教师以非思考模式提供下一token分布、且存在答案检查器的数学推理场景。方法可直接叠加在GRPO或REINFORCE++上,每个rollout增加一次教师前向,Co-RA还需训练教师LoRA;作者报告在测试预算内RA相对未训练学生的宏观Pass@K优势随K增大而扩大,直到Pass@512。
读者仍需关注:验证仅覆盖数学推理基准与同词表教师,其他领域、异构教师或更长训练预算下的行为未在文中给出;覆盖率变化混合,Co-RA在部分基准的Pass@8下降;适配后的教师自身解题能力低于冻结教师,说明引导质量与解题能力并非同一件事;作者指出教师峰值分支同时改变多个因素,未隔离机制,稠密评论式信号应如何塑形仍是开放问题;墙钟时间与峰值显存未报告。
