跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

arXiv

研究者用数学分析揭示:RLVR 中省略或截断重要性权重校正会隐式改写奖励,并提出 SMC 校正机制

该工作从数学上证明,在稀疏奖励的 RLVR 中省略或截断对富集 rollout 的重要性权重校正会隐式重新加权所定义的奖励,并将由此产生的梯度误差分解为尺度、旋转与方差;作者提出一种序贯蒙特卡洛(SMC)权重校正机制,在稳定性与粒子序假设下把标准校正方差随样本长度的指数累积缓和为加性累积,并用该分析解释 Qwen3-1.7B 在 OpenMathReasoning 稀疏片段上微调的结果,说明富集(无论校正与否)如何帮助避免稀疏域中的崩溃。