快手团队提出DARA:按奖励活跃密度加权,工具调用格式达标最多省26%训练步数、数学长度合规最多省65%
核心概要
该工作用“优势能量”刻画多奖励强化学习中各奖励对策略更新的贡献,证明在理想化GDPO归一化下某奖励的优势能量正比于其活跃组密度(批次中该奖励产生非零相对优势的 rollout 组比例),据此提出按密度反平方根加权的DARA,在工具调用与数学推理任务上比GDPO更快达到目标行为——工具调用格式合规最多少用26%训练步数,数学推理长度合规接近饱和最多少用65%步数,最终性能保持竞争力。
深度剖析
论文提出用“优势能量”(一个批次内某奖励平方优势之和)来度量每个奖励对策略更新的信号量,并证明在理想化GDPO归一化下,每个活跃组贡献相同的能量,因此批次总能量正比于活跃组密度。 GDPO通过逐奖励归一化保留了奖励内部的相对信息,但论文指出批次层面仍存在残余信号失衡:总能量随活跃组密度线性变化,稀疏奖励因此被淹没。 该关系以推导形式给出(正文式5及附录A.1),并在训练日志上得到印证:数学推理实验中第40步长度奖励的活跃组少于正确性奖励,其GDPO能量仅为正确性的31%–46%。
基于该关系,论文推导出反平方根密度校正规则,并提出DARA:以批次内最高活跃组密度为参照,给不常活跃的奖励更大权重,权重每个 rollout 批次重新计算,不改变底层策略优化目标。 与DVAO按组内标准差、SAW按批次变异系数、SA-MRPO按饱和程度、GD2PO按优势符号一致性加权不同,DARA的权重直接来自活跃组密度与优势能量的关系。 论文给出两种实现:DARA-Sym对正负优势同倍放大,可精确匹配能量;DARA-Asym只放大正优势,并给出其能量的上下界(附录A.5)。主方法为DARA-Asym。
在工具调用任务上,DARA比GDPO更快学会格式目标:格式奖励中位数达到0.8所需步数为14–15步,GDPO为19步,GRPO为34步;第60步时DARA-Sym与DARA-Asym取得最高的平均准确率(50.94%、50.69%)与平均格式分(96.06%、96.02%),基线最高为50.50%与90.11%。 论文把加速归因于密度校正补偿了稀疏奖励的活跃度,并给出可检验预测:固定2048条响应预算下增大组规模会提高活跃组密度并加快学习,实验与之一致。 工具调用实验使用ToolRL的3920条训练样本与80条验证样本,在Qwen2.5-1.5B-Instruct与3B-Instruct上对比GRPO、GDPO、DVAO、GD2PO-Hard,主实验用5个训练种子;第100步最终检查点上DARA保持竞争力而非全面领先。
在数学推理任务上,DARA的优势随长度奖励接近饱和而放大:Qwen3-4B-Instruct上DARA-Asym、DARA-Sym与GDPO达到99%长度合规的步数分别为66、59、111,DeepSeek-R1-7B上为56、50、142,相当于比GDPO少41%–65%步数;DeepSeek-R1-7B上两种DARA变体在第50步首次达到95%的留出集长度合规,GDPO为第70步。 论文指出早期多数组同时含合规与超长回答、长度奖励信息充足,接近饱和时混合组变稀少,正是密度校正发挥作用的区间;固定权重消融显示单纯加大长度权重虽提升合规却带来更大准确率损失。 数学实验覆盖DeepSeek-R1-1.5B、Qwen3-4B-Instruct、DeepSeek-R1-7B,使用DeepScaleR-Preview数据与五个公开基准(共1559题、每检查点24944次生成),并报告2000次自助重采样的置信区间。
启示与展望
该结果面向使用GRPO/GDPO类多奖励强化学习做LLM后训练的团队,适用于奖励可分解为多个通道、且各通道活跃频率差异明显的设置,例如工具调用的格式与正确性、数学推理的正确性与长度约束。方法只替换奖励聚合步骤,可直接叠加在既有训练栈上;论文报告在固定2048条响应预算下增大组规模会提高活跃组密度并加快学习,这为批次与组规模的配置提供了依据。DARA-Asym与DARA-Sym呈现不同的准确率—合规权衡,前者在DeepSeek-R1两个规模上取得最高联合得分,后者合规率最低,读者可按目标选择变体。
论文的精确能量匹配结论建立在理想化GDPO归一化与显式协方差条件之上,实际使用的DARA-Asym只放大正优势,其能量仅有上下界而非精确匹配,因此理论保证与主方法之间存在需要读者自行判断的间距。加速幅度以特定阈值(如99%长度合规、格式奖励中位数0.8)和特定模型规模衡量,换用其他奖励定义、阈值或骨干网络时幅度是否保持,文本未给出结论。第100步最终检查点上DARA与基线差距明显收窄,说明其价值主要体现在优化动态而非最终上限。此外,本次读取为全文,但部分推导细节与对比表位于附录,若需复现权重上限取值与各方法优势估计式的完整差异,仍需查阅附录A、B与C、D中的配置表。
