跳到主要内容
返回时间线
arXiv来源发表:

SLCA-GRPO 把工具段与总结段的优势分开路由,在三个骨干上把工具调用成功率提高最多 10.03 个百分点

核心概要

该工作把工具调用强化学习的轨迹拆成工具段与总结段,指出统一广播轨迹级优势会造成“跨段信用错配”,并提出 SLCA-GRPO:在同一个策略内对两段奖励分别做组内归一化并只路由到对应 token,配合 Schema-Guided LLM Simulator 与 Hierarchical Rewards,在 Qwen2.5-3B/7B-Instruct 与 Qwen3-8B-Base 三个骨干、Toucan-Test、BFCL V3 与 τ²-Bench 三个基准上报告了高于匹配 GRPO 的均值,7B 上分别为 +2.53、+1.36、+9.15 个百分点。

AI-generated editorial illustration: SLCA-GRPO: Resolving Cross-Segment Credit Misattribution in Tool-Calling RL

深度剖析

论文把“跨段信用错配”定义为一个结构性失效模式:标准 GRPO 把轨迹级优势广播给所有 token,于是总结奖励的波动会进入工具 token 的优势,在符号冲突情形下,失败的工具调用可能因为后面跟着正确总结而被强化,正确的工具轨迹也可能因为总结错误而被惩罚。 此前的时间轴信用分配方法(VinePPO、GiGPO、SPO)仍在聚合后再估计优势,ToolPO 加入局部工具奖励但仍让依赖总结的噪声到达工具 token,RLTR 则把规划器与总结器拆成流水线、放弃统一骨干;该工作把问题定位在“执行 vs 表述”这一结构轴,而不是时间轴。 论文给出诊断案例与梯度诊断:工具/总结梯度方向接近正交,而梯度范数出现不稳定尖峰,作者据此把不稳定归因于优势污染而非方向冲突(附录 B)。

SLCA 在反向传播前阻断总结到工具的优势通路:工具侧优势只路由到工具 token,总结侧优势只路由到总结 token,两段奖励在组内分别归一化,不增加 rollout 成本,也不拆分模型。 与加性增强(ToolPO)或流水线分离(RLTR)不同,这是在单一统一策略内沿结构轴解耦优势估计;作者明确把它表述为偏差—方差权衡,并给出逐更新的优势隔离命题、条件性噪声方差移除定理与方向保真推论。 理论结果是条件性的逐更新保证,作者声明不是全局无偏优化;支撑控制实验显示关闭总结到工具的支持路径在 τ²-Bench 上有 5.51 个百分点的主效应,而匹配的 w/o SLCA 同时改变了归一化与 token 支持。

配套的 SGLS 用确定性 schema 校验加冻结的跨家族 LLM 模拟工具响应,HierR 把回报拆成稠密的工具过程分与终端的总结偏好分,使分段路由在规模上可行。 SGLS 把 schema 当作控制平面,只对通过校验的调用做模板约束的模拟;HierR 的过程分由格式、工具名、参数键、参数值与并行度五项加权组成,总结分由 LLM-as-a-judge 给出。 消融显示去掉 HierR 在三个骨干上造成最大的 Toucan 成功率下降,去掉 SGLS 影响较小但改变 BFCL 与 τ²-Bench;替换响应模拟器为 GPT-OSS-120B 后 SLCA 在三个基准上仍为正增益(+2.83/+1.24/+7.16)。

在三个骨干与三个基准上,SLCA-GRPO 报告的均值高于匹配 GRPO:7B 上 Toucan 严格 Success@0.9 为 79.13%(+2.53 pp)、BFCL 为 69.77%(+1.36 pp)、τ²-Bench Pass1 为 41.02%(+9.15 pp),3B 与 8B 的对应差距分别为 +2.35/+0.40/+1.09 与 +2.05/+3.35/+10.03 个百分点。 匹配比较中 GRPO 与 SLCA-GRPO 共享数据划分、SFT 初始化、SGLS 端点、解码设置、评估协议、rollout 组大小与 HierR 奖励,只差统一优势与分段锁定优势;训练轨迹显示 SLCA 以更少平均工具轮数取得更高成功率,而标准 GRPO 稳定在更长轨迹上却没有相应成功率提升。 主结果为三次运行的均值与标准差;奖励协议敏感性实验(统一奖励比例扫描、执行式奖励替换、响应模拟器替换)中 SLCA 的增益方向保持一致。

启示与展望

该结果面向的是轨迹能清晰分成“工具调用/推理”与“最终自然语言回答”两段的工具调用后训练场景,且训练在 SGLS 模拟环境中完成、模型规模到 8B。对这类读者,可直接复用的是分段掩码加分段归一化优势的改动:它不增加 rollout 成本、不拆分模型,并可与 VinePPO/GiGPO/SPO 这类时间轴信用分配方法组合使用。作者也把 SGLS 与 HierR 定位为让路由可规模化的基础设施,因此希望复现的人需要同时准备 schema 校验式的模拟环境与分段奖励。

分段假设本身是范围条件:SLCA 假设工具调用与自由文本之间有清晰边界,内联代码生成等场景需要学习式分段。奖励侧,过程分依赖与金标轨迹匹配,当多个 API 方案都能解决同一请求时可能低估替代方案;Toucan 的严格 Success@0.9 是对该分数取阈值,而非独立任务结果标签。工具段内部的时间信用未被区分,一个标量被路由到所有工具 token,因此正确 Action 1 与失败 Action 2 无法区分,与 VinePPO/GiGPO/SPO 的组合尚未测试。规模上实验止于 8B 且使用 SGLS,更大规模训练与直接真实 API 对比仍是未来工作。此外,本次读取的是正文与附录的完整文本,但图表以文字与表格形式呈现,图形中的曲线细节只能依据正文描述理解。

来源