跳到主要内容
返回时间线
arXiv来源发表:

CorrGRPO 用皮尔逊相关替代协方差归一化,在代码生成、工具调用与智能体安全三类多奖励任务上超过 GRPO

核心概要

该工作指出 GRPO 在多奖励场景下用总奖励的组内标准差做归一化,其方差等于所有成对奖励协方差之和,因而大尺度奖励会主导归一化并压制小尺度奖励的信号;作者提出 CorrGRPO,把分母中的成对协方差替换为皮尔逊相关系数,同时保留中心化总奖励不变,并在代码生成、工具调用、智能体效用与安全三类任务、0.5B 至 8B 参数模型上与 GRPO 及 GDPO 等变体比较,报告三类任务上的性能提升以及竞争性目标之间经验帕累托前沿的外扩。

AI-generated editorial illustration: CorrGRPO: Correlation-Normalized GRPO for Multi-Reward Learning

深度剖析

论文给出 GRPO 多奖励优势估计的协方差视角:当 GRPO 把各奖励分量求和并用组内标准差归一化时,其方差等于所有成对奖励协方差之和,因此分母同时包含各奖励自身方差与两两依赖。 此前 GRPO 的组相对归一化通常被当作一个整体缩放项使用,该工作把这一分母显式分解为协方差矩阵元素之和,指出在中心化总奖励固定时,正相关越强优势幅度越小、负相关越强优势幅度越大,从而把“奖励之间的统计关系”变成可分析的归一化机制。 该结论以方差分解恒等式给出,论文在附录中给出总体恒等式与有限样本下样本方差等于样本协方差之和的精确等价推导,并说明该等价要求方差与协方差使用同一样本、同一均值与同一除数。

论文指出协方差归一化把奖励依赖与奖励尺度纠缠在一起:由于协方差等于两分量标准差之积乘以皮尔逊相关系数,数值尺度大的奖励会同时主导对角项与非对角项,使小尺度奖励对归一化的影响被压制。 这为多奖励 GRPO 中“某些奖励看似被配置了权重却影响有限”提供了一个可量化的解释路径,论文用四个轨迹、三个奖励的示例说明第三个奖励虽然与其他奖励相关性很弱,但其方差单独就占了协方差和的很大部分。 论证由协方差分解与一个具体数值示例支撑,并在附录中通过固定中心化总奖励、扫描某一奖励标准差的对照分析展示 GRPO 优势随该尺度单调下降,而 CorrGRPO 优势在正尺度扫描下保持不变。

论文提出 CorrGRPO:把分母中的成对协方差替换为样本皮尔逊相关系数,保留中心化总奖励作为分子,使每个非零方差奖励在对角线上贡献相同权重,非对角项只反映相关性的强弱与方向。 与按方差重加权(如 MO-GRPO)、逐奖励独立归一化后再聚合(如 GDPO)、以及引入分位数归一化与马氏白化(如 RDPO)等路线不同,CorrGRPO 保留训练目标给定的相对奖励权重,只改变归一化分母的构成。 论文给出零方差分量处理约定(对应行列置零)并证明所得矩阵仍为半正定、相关和为非负、加上数值稳定项后分母严格为正;附录还给出与 DAPO、CISPO、GDPO 的兼容性推导,并在 Qwen2.5-Coder-7B-Instruct 上报告了与 CISPO 结合的对比结果。

论文在代码生成、工具调用、智能体效用与安全三类多奖励任务上,用 0.5B 到 8B 的模型与 GRPO 及 GDPO 等变体比较,报告三类任务上的改进以及经验帕累托前沿的外扩。 该工作把相关性归一化放到三类奖励结构差异明显的场景中检验:代码任务含可相互促进的七项奖励,工具调用含四项部分给分奖励,智能体任务含效用与安全两项可能相互竞争的奖励。 代码任务在 LeetCodeDataset 的 2,641 题训练、228 题评测,并在 HumanEval、MBPP、LiveCodeBench v6 上零样本迁移,报告相对 GRPO 平均 Pass@1 在 0.5B、1.5B、3B、7B 上分别提升 2.09、0.80、2.27、4.21 个百分点;工具调用在 RLLA-4K 的 3,920 训练、80 评测样本上训练并迁移到 API-Bank,三个主干的全精确分数与 API-Bank 平均分均提高;智能体任务在 AgentDojo 的 1,584 训练、411 评测样本上训练并迁移到 ASB 与 InjecAgent,报告 ASB 联合准确率与 InjecAgent 攻击成功率的改善。

启示与展望

该结果面向使用组相对优势估计、且奖励由多个分量构成的语言模型强化学习训练流程,适用对象包括代码生成、结构化工具调用以及工具型智能体的效用与安全联合训练;论文给出的实现约定(零方差分量对应行列置零、相关和截断为非负、数值稳定项)以及训练配置(如代码任务批量 64 提示、组大小 8,工具调用批量 128 提示、组大小 4,智能体任务批量 16 任务、组大小 4)为复现提供了具体入口。对读者而言,这意味着在奖励分量数值范围差异较大、且分量之间存在可解释依赖关系时,可以优先考虑把归一化分母从协方差改为相关性;论文同时说明该方法可与 DAPO、CISPO、GDPO 结合,因此也可作为已有训练管线的局部替换项来评估。

仍值得关注的是:相关性归一化在奖励分量数量更多、分量间存在强负相关或近似共线时,相关矩阵接近奇异会如何影响优势尺度,论文以数值稳定项与半正定性论证处理了这一情形,但未给出跨任务的一般性结论;论文报告的是基准上的改进,安全实验明确说明“改进这些基准并不代表真实部署安全,也不代表能抵御未见攻击”,因此真实环境中的效用与安全权衡仍需按应用单独评估;此外,相关性归一化不纠正有偏或设定错误的奖励,行为仍取决于所选目标及其权重。就本次可读到的文本而言,正文与附录给出了方法、推导、训练设置与主要结果表,但部分附录中的示例提示与响应内容在证据包中以占位形式呈现,若需要逐条核对奖励计算细节,仍需查阅原文附录中的完整示例与代码仓库。

来源