贝尔曼策略优化:用贝尔曼方程把策略镜像下降改写成无评论家的轨迹级目标
核心概要
该工作提出贝尔曼策略优化(BPO),一种从策略镜像下降(PMD)推导出的无评论家方法:在带终端奖励的自回归生成中,用贝尔曼方程把 PMD 改写为轨迹级目标,从而避免估计中间状态的价值,并证明该目标与原 PMD 目标具有相同的唯一最优解;其实际损失以互补 token 概率的平滑比值作为失配修正权重,替代 GRPO 的重要性采样比值,在数学推理基准上取得优于 GRPO-ClipHigher、GSPO、CISPO 与 DPPO 的平均准确率。
深度剖析
提出并证明了一个无评论家、轨迹级的 PMD 改写:在终端奖励设定下,贝尔曼方程把每个 token 的优势写成相邻状态价值函数之差,这些差沿一条回答逐项相消,只剩终端奖励与初始价值,因此目标只依赖终端奖励和初始价值函数,不需要中间状态的价值或优势估计。 相对直接实现 PMD 需要为每个访问到的中间状态估计价值(通常要训练单独的价值模型,增加显存与计算开销,且学习到的价值在推理任务上可能不准确),该改写把价值估计从中间状态移除;相对 GRPO 及其变体这类无评论家方法,它给出了从 PMD 出发的推导路径。 论文给出定理 1 及其充分性与必要性证明:在 rollout 策略可达状态上,改写目标与原 PMD 目标具有相同的唯一最优解,等价性对任意正权重函数成立;必要性证明借助 token 级残差在 rollout 策略下构成鞅的论证。
从该轨迹级目标出发,通过线性化平方残差、用分组 rollout 估计初始价值与提示相关缩放因子、以二元 KL 散度近似完整反向 KL 散度并做加性平滑、掩码与截断,得到实用的 BPO 损失;其失配修正权重是互补 token 概率的平滑比值,替代了 GRPO 的 token 级重要性采样比值。 GRPO 使用 PPO 式截断代理目标与 token 级重要性采样比值;BPO 保留 GRPO 的逐 token 损失形式,但把重要性采样比值换成截断的失配修正权重,该权重由 rollout 与当前 token 概率决定并做加性平滑以提升数值稳定性。 推导按四个步骤展开(线性化近似、分组估计与归一化、二元 KL 近似与加性平滑、掩码与截断),其中二元 KL 恒等式在附录 A.2 给出证明;论文同时说明二元 KL 散度是完整 KL 散度的下界。
在 Qwen3-30B-A3B-Base 上以 DAPO-Math-17k 英文子集训练,并在 AIME24、AIME25、AIME26 上以 Avg@32 估计 Pass@1,BPO 取得 50.5% 的平均准确率,高于 GRPO-ClipHigher 的 39.5% 与最强基线 CISPO 的 47.4%,分别高出 11.0 与 3.1 个百分点,且在三个基准上均为最高。 在只改变策略损失、其余实验设置完全一致的受控比较下,BPO 相对 GRPO-ClipHigher、GSPO、CISPO、DPPO 四种基线均取得更高平均准确率;训练 400 步后其平均准确率为 49.4%,而训练结束时最强基线 DPPO 为 45.5%。 每个 rollout 批次含 256 个提示、每提示 16 条回答,共 4096 条回答分为 8 个 512 条的小批次;训练 400 步、对应 3200 次优化器更新,最大回答长度 16384 token,所有方法使用 rollout-router replay(R3);表 1 报告各方法在三个基准平均准确率最高检查点的结果。
在 Qwen3-4B-Base 上以 1000 步训练对两个超参数做消融,BPO 在平滑参数与截断参数的多种取值下表现相近,并均高于 GRPO-ClipHigher 基线。 消融显示 BPO 对平滑参数从某值到另一值不敏感(平均准确率 25.4%–25.8%),对截断参数的三个取值平均准确率在 25.3%–25.8% 之间、跨度 0.5 个百分点,均超过 GRPO-ClipHigher 的 20.5%。 消融使用每批 128 个提示、每提示 16 条回答(共 2048 条回答,分 4 个 512 条小批次),最大回答长度 8192 token,每次扫描只改变一个超参数并共享同一 GRPO-ClipHigher 基线。
启示与展望
该结果面向带终端奖励的自回归生成与可验证奖励的强化学习设定,实验在数学推理基准(AIME24、AIME25、AIME26)上以 Qwen3-30B-A3B-Base 训练于 DAPO-Math-17k 英文子集,消融在 Qwen3-4B-Base 上进行;理论等价性限定在 rollout 策略可达状态上。这为后续工作提供了可复用的推导框架与损失形式,适用于希望在不训练价值模型的前提下改进策略优化的研究者与工程实践者,前提是任务能提供终端可验证奖励。
读者仍会关注:该等价性与损失在数学推理之外、以及在其他基座模型与更长训练规模下的表现;失配修正权重中平滑与截断参数在更大模型上的取值影响;以及论文中部分数值在摘要与正文中以占位形式呈现,若需精确数字应回到原文表格核对。此外,本次读取为全文,但图表中的具体曲线数值需以原文图 1 为准。
