跳到主要内容
返回时间线
arXiv来源发表:

CARM 用绝对值平均替代几何平均掩码,在 AIME 2024/2025/2026 与 BeyondAIME 上把 mean@16 提升最多 3.13 个百分点

相关研究与后续进展

核心概要

该工作提出取消感知响应掩码(CARM),在序列级掩码中先对每个 token 的对数概率比取绝对值再平均,以避免正负漂移相互抵消,并证明被接受响应满足关于超出规定区间的采样 token 比例与其平均对数距离的联合界;在数学推理与代码生成实验中,CARM 相对几何平均掩码在 AIME 2024/2025/2026 与 BeyondAIME 平均的 mean@16 上最多提升 3.13 个百分点,在四个代码基准的平均 pass@1 上相对最强基线提升 2.88 个百分点。

Source-provided article image: CARM: Cancellation-Aware Response Masking for LLM Reinforcement Learning
Figure 1 ·

Figure 1: A real unfiltered rollout that GeoMean accepts and CARM rejects. This 8,619-token response has scores s GeoMean = 1.0025 ≤ 1.005 s_{\mathrm{GeoMean}}=1.0025\leq 1.005 and s CARM = 1.0248 > 1.02 s_{\mathrm{CARM}}=1.0248>1.02 . Top: positive and negative log-ratio mass and prefix deviations. Bottom: a 103-token window; red tokens have log ⁡ r t > 0 \log r_{t}>0 , green tokens have log ⁡ r t < 0 \log r_{t}<0 , and color intensity encodes magnitude.

arXiv

深度剖析

CARM 是一种序列级掩码,先对每个 token 的对数概率比取绝对值再平均,从而阻止方向相反的概率变化在序列内相互抵消。 常见做法使用采样 token 概率比的长度归一化几何平均,其带符号对数比会在不同位置抵消,从而掩盖显著的双向策略漂移;CARM 以绝对值平均替代这一规则。 摘要给出方法定义与动机,并说明该掩码用于判断整条响应是否参与优化;未提供实现细节或消融数据。

作者证明被接受的响应满足一个联合界:既约束采样 token 比率落在规定区间之外的比例,也约束其超出区间边界的平均对数距离。 该结果为掩码接受条件提供了理论刻画,而不仅是经验性阈值选择。 摘要陈述该证明存在,但未给出定理形式、常数或证明技术。

在数学推理任务上,CARM 相对几何平均掩码把 AIME 2024/2025/2026 与 BeyondAIME 平均的 mean@16 提升最多 3.13 个百分点。 该比较直接针对被替代的几何平均掩码规则,量化了取消感知带来的收益。 摘要报告了提升幅度与基准集合,但未给出各基准单独数值、模型规模或训练配置。

在代码生成任务上,CARM 在四个代码基准上的平均 pass@1 相对最强被评估基线提升 2.88 个百分点。 收益在数学推理之外的第二个任务族上得到报告,支持该掩码的跨任务适用性。 摘要给出平均提升与基线选择方式,未列出四个基准名称或逐项结果。

启示与展望

该工作面向使用强化学习进行后训练的 LLM 系统,适用于 rollout 与训练引擎存在差异、策略更新导致采样响应离策略的场景。其直接使用者是构建与调优 LLM 强化学习训练流程的研究者与工程师,他们可以在序列级掩码环节用 CARM 替换几何平均规则。摘要所述证据覆盖数学推理(AIME 2024/2025/2026 与 BeyondAIME 的 mean@16)与代码生成(四个基准的平均 pass@1)两类任务,因此结论的适用范围应理解为这两类可验证任务上的后训练设置。

摘要未说明定理的具体形式、区间参数如何选取,也未给出各基准的单独成绩、模型规模、训练步数与计算开销,因此收益在不同模型与训练预算下的稳定性仍待观察。几何平均掩码之外是否还有其他基线被比较、绝对值平均对训练稳定性的影响如何,摘要均未展开。此外,本次读取范围仅为摘要,正文中的图表、附录与实现细节未纳入,若需判断工程可复现性,应以原文方法章节与实验表格为准。

来源