跳到主要内容
返回时间线
发表出处待核验来源发表:

SAGE 优化器让生成式推荐在 Amazon 与 RecIF-Bench 上同时提升准确率、冷启动召回与多样性

核心概要

该工作识别出 GBPO 在生成式推荐中的“对称保守”失效模式(对称更新上界压制冷启动等稀有正信号、静态负样本约束无法阻止多样性坍缩、组归一化多目标奖励导致训练信号分辨率低),提出 SAGE 优化器,用几何平均序列级重要性比率与解耦多目标优势估计降低 token 级方差并缓解奖励坍缩,并用非对称自适应边界对成功列表施加正向 Boost、对低多样性失败施加熵感知惩罚;在 Amazon Product Reviews 三个类目与大规模 RecIF-Bench 上,采用原生文本词表的 TextRec 在 top-K 准确率、冷启动召回与多样性上均优于 OneRec-GBPO,并保持训练数值稳定。

AI-generated editorial illustration: SAGE: Sequence-level Adaptive Gradient Evolution for Generative Recommendation

深度剖析

论文识别并命名了 GBPO 的“对称保守”失效模式:对称更新上界压制稀有正信号(如冷启动物品),静态负样本约束在拒绝主导反馈下无法阻止多样性坍缩,组归一化多目标奖励导致低分辨率训练信号。 此前 GBPO 被视为解决负样本梯度爆炸的稳定方案,本文把它的对称保守设计重新定位为推荐场景下的结构性瓶颈,并给出冷启动视频观看下降 44.7%、簇密度上升 11.7% 的观察。 基于对 OneRec-V2/GBPO 机制的分析与文中报告的观察数值,属于诊断性论证而非独立对照实验。

SAGE 用几何平均的序列级重要性比率替代 token 级比率,并配合解耦多目标优势估计(先按目标在采样组内独立归一化再聚合,最后做批级 z-score 归一化),以降低 token 级方差并缓解多目标奖励坍缩。 相对 GRPO 的组内归一化与 GBPO 的保守边界,SAGE 把重要性比率提升到列表级(固定列表长度 L=10),并借鉴 GDPO 的解耦归一化思路,使点击、时长、评论等目标在聚合前各自保持分辨率。 方法层面给出公式与算法流程,消融显示用简单加权奖励和替换信号解耦会降低 NDCG@10 等指标。

SAGE 引入非对称自适应边界:对正反馈列表用 Boost 因子(ε_boost 取值 0.2–0.5,实验设为 0.3)允许超线性更新,对负反馈列表用基于列表熵的调节因子 λ 对低多样性失败施加更强惩罚。 相对 GBPO 将正更新上界封在 1.0 的对称设计,SAGE 借鉴 DAPO 的 Clip-Higher 与 BAPO 的熵裁剪思路,把探索与惩罚做成随样本和熵变化的动态边界。 消融显示移除 Positive Boost 会大幅降低冷启动召回,移除熵惩罚会明显降低 Entropy@10,说明各组件在各自目标区域起作用。

在 Amazon Product Reviews(Beauty、Sports、Toys)与 RecIF-Bench 上,使用原生文本词表并以 SAGE 优化的 TextRec 取得最佳 top-K 准确率,相对 OneRec-GBPO 的 NDCG 提升约 6.27%–7.8%,同时冷启动召回与多样性显著改善。 相对依赖独立 Semantic-ID 词表的 OneRec 系列,本文显示直接复用 LLM 原生词表配合偏好优化可在准确率上超越 Semantic-ID 架构,并在指令条件任务(Interactive Rec、Label-Conditional Rec)上优势更明显。 覆盖三个 Amazon 类目与 RecIF-Bench 六个任务,含约 120M 交互、200K 用户与严格按用户划分的协议;冷启动召回相对提升约 89.9%–101%,熵提升约 11.17%–11.64%。

启示与展望

该结果面向列表式生成推荐场景,适用于以 Qwen3-8B 为骨干、列表长度 L=10、采用 SFT 加 RLHF 两阶段流程的系统,并在 Semantic-ID 与原生文本两种动作空间下验证。对希望缓解冷启动压制与多样性坍缩、同时保持训练数值稳定的团队,SAGE 提供了可直接替换 GBPO 的优化器选项;对多目标反馈(点击、时长、评论等)需要保持信号分辨率的场景,解耦优势估计提供了可复用的做法。文中也指出原生词表推荐需要语言级物品渲染,对延迟敏感系统构成部署约束,因此该路线更适合算力与部署工具持续改善的环境。

读者仍会关注:SAGE 在 Semantic-ID 动作空间下准确率提升并不稳定(OneRec-SAGE 表现竞争但未持续领先),说明强探索与离散受限动作空间的相互作用仍需进一步刻画;冷启动与多样性提升伴随的准确率—多样性权衡在不同业务目标下如何取舍,文中以原生文本设置更优作为经验观察,尚待更多场景验证;此外,本文为全文解析,但正文中算法伪代码与部分图表引用存在不完整之处(如 Algorithm ?? 与图 5 仅以归一化描述呈现),若需复现具体数值与超参敏感性,仍需查阅原始图表与代码。

来源