跳到主要内容
返回时间线
arXiv来源发表:

检索信用如何分配决定搜索智能体训练收益:局部信用让Qwen3-4B平均F1从51.25升至54.34

核心概要

该研究构建了带中间证据标注的语料接地问答数据,比较三种检索信号(证据覆盖Cov、带依赖覆盖Cov-Dep、答案匹配AM)在标量奖励加成与动作对齐局部信用两种分配方式下的效果,用Qwen3-4B在七个问答基准上训练,发现局部信用优于标量,Cov-local平均F1达54.34,高于仅用结果奖励的51.25。

Source-provided article image: Beyond Outcome Rewards: Constructing and Assigning Retrieval Credit for Search Agents
Figure 1 ·

Figure 1: Observed coverage and schematic credit assignment. (a) An observed search matches v 1 v_{1} and v 3 v_{3} ; the missing father link at v 2 v_{2} blocks dependency credit for v 3 v_{3} , giving Cov 0.67 and Cov-Dep 0.33. Text is abridged. (b) Scalar changes the shared advantage; local retains the outcome advantage and adds credit on executed query tokens (Equations 4 – 5 ). Tool observations are masked. Colour shows support, not magnitude.

arXiv

深度剖析

同一检索信号在不同信用分配方式下效果不同:局部信用在每个信号上都优于标量加成,其中证据覆盖收益最大,Cov-local平均F1为54.34,而仅结果奖励(OO)为51.25。 此前工作多将中间检索奖励并入结果奖励,本文把“奖励什么”与“信用如何进入策略更新”作为两个耦合设计维度分别比较。 在相同14000道训练题、相同GRPO设置与训练预算下,对Qwen3-4B在七个基准(共3197题)上比较13种条件,报告最终检查点的F1与EM。

依赖约束的作用随分配方式反转:去掉依赖闭包使局部F1从52.96升至54.34,而标量F1从52.82变为52.64,说明更受约束的证据信号不一定提供更有用的监督。 Cov与Cov-Dep共享同一证据节点与接地,仅差是否要求前置节点先被计入,从而把依赖这一选择单独隔离出来。 两种覆盖信号使用相同的段落匹配规则与标注,比较在相同题目与接地条件下进行。

局部信用需要与产生证据的搜索动作保持对应:打乱事件质量后,Cov平均F1下降2.12,AM下降3.12,且多跳问答上的差距更大。 置换条件保留有符号事件质量与支持集,只破坏事件与动作的对应关系,从而检验对齐本身是否重要。 对齐与置换条件在相同题目、相同搜索步上比较,Cov-permute仍高于OO(52.22对51.25),AM-permute低于OO(50.39)。

局部信用的价值不限于结果奖励无法区分轨迹的组:对Cov,排除平局组仅降0.32,而只保留平局组降2.27;AM同样排序,损失分别为1.44与2.19。 flat-only与no-flat限制在保留结果优势的同时改变局部信用施加的组,检验其收益是否集中于结果平局。 两种信号下全组使用均取得最高聚合F1,且两种限制同时减少了局部信用的总量。

启示与展望

该框架面向需要多步检索的多跳问答训练场景,适用于具备可验证答案与语料接地标注的检索环境;作者指出其分析聚焦证据获取与检索信用,并建议将控制条件扩展到不同模型规模与检索器以检验这些信用分配行为是否泛化。对希望复现的读者,论文说明代码、训练模型与构建数据集将在接收后发布,附录给出训练设置、数据构造与接地检查。

开发集分析显示Cov-local提高了平均覆盖(27.51%升至31.97%)并减少零覆盖问题(616降至551),但同一覆盖水平下F1并未一致更高,且各覆盖水平上的题目集合不同,因此证据使用是否改善仍是开放问题。作者也指出奖励构造与更新强度的交互、事件时机与奖励幅度的独立变化尚待研究。此外,开发集与训练集存在证据重叠(507题共享部分标注证据,693题完全未见),作者说明这限制了其衡量泛化性的价值。

来源