跳到主要内容
返回时间线
arXiv来源发表:

RLVR 后训练被证明允许无界语言漂移,而监督微调不会,且漂移只在基座模型无法完成的新推理任务上出现

相关研究与后续进展

核心概要

该工作从理论与实证两方面刻画了 RLVR 后训练中思维链语言漂移的产生条件:理论上证明 RLVR 的优化压力允许无界语言漂移而监督微调不会,实证上显示漂移专门出现在基座模型无法引出目标行为的新推理任务上,并进一步证明在不约束期望奖励的前提下无法约束语言漂移。

Source-provided article image: On Language Drift during RLVR Post-Training
Figure 1 ·

Figure 1 : SFT (left) on prompt/CoT/answer triples ( x , z , y ) (x,z,y) does not permit a model π ( SFT ) \pi^{(\textit{SFT})} to drift arbitrarily far from a human language distribution P ( HL ) {P^{(\textit{HL})}} while minimizing cross-entropy with a target distribution D ( SFT ) {{D}^{(\textit{SFT})}} . RLVR (right) places no optimization pressure on the CoT z z , allowing arbitrary language drift away from natural language in the reasoning trace. The example completions in this figure were drawn from Llama-3.2-1B models trained via SFT and RLVR (respectively) on GSM8K.

arXiv

深度剖析

论文从理论上证明,RLVR 的优化压力允许无界语言漂移,而监督微调不具备这一性质。 此前语言漂移虽被记录在案,但其成因“poorly understood”;该工作把成因从现象描述推进到优化目标层面的形式化区分,指出 RLVR 与监督微调在是否允许无界漂移上存在本质差异。 证据为理论证明,摘要以“we prove theoretically”表述,未给出证明细节、假设或定理数量。

语言漂移专门在 RLVR 训练于新推理任务时出现,即当目标行为无法从基座模型中引出时。 把漂移的出现条件与任务新颖性、基座模型能力边界绑定,而不再只是把漂移当作训练过程中的普遍副作用。 证据为实证结果,摘要以“we show empirically”表述,未提供模型规模、任务集合或漂移度量方式。

论文证明无法在不约束期望奖励的情况下约束语言漂移,因此在前沿 RLVR 后训练中,提升思维链可监控性必然伴随性能损失。 把可监控性与性能之间的取舍从经验观察提升为可证明的不可能性结论,为“漂移会损害 CoT monitorability”这一既有担忧给出形式化支撑。 证据为理论证明,摘要以“we prove that it is not possible”表述,未给出权衡的定量形式或界。

启示与展望

该结果面向采用可验证奖励强化学习进行后训练的推理模型,尤其是目标行为无法从基座模型直接引出的新推理任务场景;对这类场景,它提示可监控性与期望奖励之间存在结构性取舍,适用于设计后训练目标与思维链监控流程的研究者与工程团队。

摘要未说明理论证明所依赖的假设、奖励模型形式与任务分布,也未给出实证中的模型规模、任务集合与漂移度量方式;因此“无界漂移”与“不可能约束”的具体边界、以及结论在何种奖励与任务条件下成立,仍需在正文中确认。

来源