CIS 把训练-推理不匹配改写为对数几率位移,在三个 MoE 模型五个数学推理基准上取得最高平均分
核心概要
该工作研究大语言模型可验证奖励强化学习(RLVR)中推理引擎采样、训练引擎计算梯度所导致的训练-推理不匹配,提出校准重要性采样(CIS):先用对数几率上的加性位移刻画不匹配,再对正位移施加单一常数阈值截断,从而得到随 token 置信度升高而收紧的重要性比率上限;在三个 MoE 模型与五个数学推理基准上,CIS 在全部三个模型上取得所评估基线中最高的五基准平均分,诊断分析显示其对低置信度 token 的截断偏差小于截断重要性采样(TIS),而对小重要性权重的上向裁剪会降低留出准确率。
深度剖析
论文把训练引擎与推理引擎之间的不匹配写成对数几率坐标上的加性位移,并给出比率-位移恒等式:不匹配比率等于位移因子乘以置信度因子。 以往方法直接对重要性比率或其派生量设阈值,而该比率混合了引擎间真实差异与 token 自身置信度两个因素;本文把两者显式分离,使不匹配本身可以被单独度量。 基于大规模 rollout 上两引擎对同一采样 token 的概率测量:稠密对照模型上位移集中于零附近,MoE 模型上则出现明显重尾,且该重尾在映射到对数几率位移后依然保留。
基于该刻画提出 CIS:对正位移在单一常数阈值处截断,映射回比率空间后得到随 token 置信度升高而收紧的比率上限。 固定比率上限(如 TIS)在位移坐标中对应一个随置信度升高而越来越宽松的阈值,因此其截断偏差集中在低置信度 token 上;CIS 在每个置信度水平上对同样大小的位移作同样处理。 理论分析表明 CIS 把精确重要性采样中无界的二阶矩替换为被常数界住的项,代价是由被截断超出量控制的偏差;诊断显示在低置信度区间 CIS 引入的偏差不到 TIS 的一半,整体偏差更低(文中报告为低于 TIS 的对应值),而新增方差仍远低于精确比率。
在三个 MoE 模型(Qwen1.5-MoE-A2.7B、DeepSeek-V2-Lite、Qwen3-30B-A3B)与五个数学推理基准上,CIS 取得所评估基线中最高的五基准平均分。 与 token 级(精确比率、TIS、IcePop、KPop†)、序列级(Seq-TIS、Seq-MIS、GSPO)与数值级(FP16)基线在同一训练配方下比较,CIS 在三个模型块中均为最高均值。 所有方法共享同一训练配方与代码路径,仅在不匹配处理方式上不同,报告三次训练种子的均值与标准差;作者明确指出在若干迁移基准上 CIS 相对 IcePop 的优势小于种子间波动,因此不把这些单列解读为统计上可分离。
消融支持三个设计要素:只截断上侧、在位移源头截断、以及一个数值下限。 把置信度相关的 CIS 边界换成固定 TIS 上限会降低平均准确率,双侧带(同时抬升小位移)降到基座模型以下,去掉数值下限同样使平均准确率下降。 消融在 Qwen1.5-MoE-A2.7B 上逐项改变算子中的一个元素,其余保持默认;阈值扫描显示每个正阈值都优于未校正运行,默认阈值给出最高准确率。
启示与展望
该结果面向使用解耦式 RL 后训练框架、以推理引擎采样、训练引擎计算梯度的团队,尤其是 MoE 模型场景;方法以逐元素算子形式实现,不改变数值精度也不记录路由,因此可与降低不匹配本身的手段(如路由重放、FP16 训练)叠加使用。理论部分在每 token 梯度有界、token 贡献独立的假设下给出上界,并说明相关贡献时样本量需作替换。作者指出任何有限上限的截断都享有类似形式的界,因此理论说明的是为何需要截断,而非在各类有界上限之间排序。
所提供的文本中,主结果表与消融表的数值单元格为空,因此无法在此核对各基准的具体分数与种子波动,只能依据正文叙述判断相对排序。作者列出的范围包括:只训练了 MoE 模型而未训练稠密模型;测量与训练使用 bf16 及特定引擎,其他内核或数值格式可能改变不匹配规模并需要重新调整阈值;阈值与下限在 Qwen1.5-MoE-A2.7B 上从预注册网格选出后固定用于另外两个模型,而基线使用各自参考实现的默认超参数;异步训练中位移还包含陈旧 rollout 的策略滞后,本文未单独建模;token 级校正只修正给定前缀下的条件分布,不修正前缀分布本身的偏移。
