EAPO 用熵与优势符号的非对称信用分配,在四个骨干模型上把数学推理平均准确率推到最高
核心概要
该工作提出 Entropic Advantage Policy Optimization(EAPO),把归一化策略熵与响应优势的符号耦合,对成功响应中的高熵决策加强强化、对失败响应中的低熵决策加强惩罚、同时削弱不确定位置的惩罚,从而在不引入辅助模型、额外采样或特权信息的前提下把响应级优势重新分配到 token 级,并在数学、逻辑与算法推理任务上取得最佳总体表现。
深度剖析
作者先做了一项重采样分析:在 Qwen3-4B/8B-Base 上各取 20 道中等难度数学题,每题随机选两条正确与两条错误响应,在匹配相对位置的高、低熵 32-token 窗口前固定前缀各采样 64 条续写,发现正确响应从高熵窗口重采样时再次成功的比例明显低于低熵窗口(如 Qwen3-4B-Base 奖励 0.390 对 0.578),而错误响应从低熵窗口重采样时仍倾向失败(0.070),但从高熵窗口重采样准确率反而更高(0.163)。 此前工作把高熵位置普遍视为探索分支点,但没有区分“不确定下的成功”能否复现、以及“自信的失败”能否避免;这里用重采样重叠度与最终答案准确率把这两种情形分开刻画。 证据来自两个模型各 20 道题、每题 2 正 2 负响应、每窗口 64 条续写的受控重采样,并匹配了窗口相对位置以控制重采样起点;作者另报告窗口起始位置均值接近响应中部,两类窗口无系统性先后。
作者进一步分析 2,376 条 Qwen3-4B-Base 数学响应中每条正确/错误响应熵最高与最低 10% 尾部的归一化词频,发现正确响应的高熵位置富集“let's”“consider”等探索性表达,错误响应的低熵位置更常见“finally”“confirm”等结论标记,而错误响应的高熵位置也出现“try”“instead”等探索性表达。 这把重采样层面的统计规律落到可观察的语言标记上,说明失败响应中仍保留可供恢复的替代路径,而不只是整体准确率的差异。 证据是单一模型 2,376 条响应的词频对比,属于相关性描述,作者据此提出而非证明非对称信用分配的动机。
EAPO 用批次内第 10 与第 90 百分位对 token 熵做归一化并截断、作为不传梯度的信用信号,再以符号化不确定性把响应优势按 token 重新分配:正优势时偏向高熵决策,负优势时偏向低熵决策,权重经响应内均值归一以保持优势的响应内均值与符号,任意两个权重之比受超参数 β 约束。 与 EntropyAdv 的非负熵奖励、HAPO 的保号熵调整、80/20 只更新最高熵 20% token 不同,EAPO 在强化与惩罚两侧反转熵偏好,且只使用 rollout 已有的熵与优势,不需要辅助模型、token 级监督或特权信息。 方法本身是确定性的重加权,作者给出 KL 正则化不确定性分配(命题 1)与负更新下未选 token 分布集中(命题 2)两个命题及证明,并在附录给出二值决策模型下成功/失败反馈信息随熵反向变化的命题 3。
在六个竞赛级数学基准(AIME24/25/26、HMMT26、AMC23、MATH500-H,共 297 题)上,EAPO 在四个骨干上取得最高平均 avg@32 与 pass@32:Qwen3-4B-Base 与 Qwen3-8B-Base 平均准确率 31.0% 与 34.0%,分别超过最强熵类基线 5.6 与 4.3 个百分点;Qwen3-4B 与 Olmo-3-7B-Think-DPO 上为 72.4% 与 74.3%;在 Reasoning Gym 八个逻辑、空间与算法任务上宏平均 34.89% 与 43.02%,并在 AIME26 上随采样预算 1 到 256 保持最高 pass@k。 增益同时出现在基础模型与推理模型、分布内数学与分布外推理任务上,且在消融中显示高熵强化配低熵惩罚的组合最优(Qwen3-4B-Base 上比均匀信用高 6.52 个百分点),说明收益来自非对称方向而非单纯增加熵或延长响应。 主结果为四个骨干、六个基准、每题 32 条采样的 avg@32/pass@32 对比,含五个 RLVR 基线与初始骨干;另有匹配 token 预算的续写实验、1.7B 到 14B 的规模趋势、LoRA 与全量微调对比以及三个随机种子的训练奖励曲线作为稳健性证据。
启示与展望
该结果面向使用可验证奖励训练 LLM 推理的研究与工程场景:EAPO 只需策略自身的熵与已有响应优势,因此可直接嵌入 GRPO 类管线,适用于基础模型与推理模型两类骨干,并在数学竞赛题与 Reasoning Gym 的逻辑、空间、算法任务上被验证。对读者而言,这意味着在不引入辅助模型、额外采样或特权信息的前提下,多了一条改善探索的现成选项;作者也指出,其信用分配依赖模型自身不确定性与真实决策贡献的对齐程度,因此更适用于模型不确定性尚能反映推理分支的设定。作者把跨状态、跨轨迹组合已有发现列为后续方向,并提到科学发现中维护多样候选并迭代复用的做法。
熵作为信用信号反映的是模型自身的学习偏好与置信度,其与单个推理决策真实贡献的对齐程度仍是开放问题;机制分析聚焦于从给定推理状态出发的替代续写,跨状态或跨轨迹组合发现尚未展开。消融显示较大的 β 通常提升更快但训练更不稳定,默认值是在稳定性与集中度之间折中。此外,主结果以 avg@32 与 pass@32 报告,训练在 DAPO-Math-17k-Processed 上以 LoRA 为主,全量微调与多种子结果作为补充;这些设定之外的表现仍需读者结合自身任务判断。
