多步查询改写智能体以语料反馈迭代检索,在TopiOCQA上把MRR从37.8提升到41.4
核心概要
该工作把会话查询改写重构为序贯检索问题:一个智能体在意图解析、词汇改写与伪文档合成三类动作间选择,每步检索后以返回段落为反馈再改写,仅用检索质量奖励经监督微调加强化学习训练,无需人工改写标注;在TopiOCQA与QReCC上取得最高MRR与NDCG@3,并可零样本迁移到TREC CAsT及稠密检索后端。
Figure 1: Retrieval quality on TopiOCQA and QReCC (BM25) as the 5-step agent is truncated at inference to a maximum of one to five steps.
arXiv深度剖析
将单步改写改为多步、带语料反馈的序贯决策,智能体在意图解析、词汇改写、伪文档合成与停止四类动作中逐步选择,每步以已检索段落为条件。 此前的检索对齐方法(如ConvSearch-R1)在见到任何检索文档前就固定改写,伪相关反馈方法则把反馈机制预先手工设定;这里让智能体从检索奖励中学习每步用哪种改写、何时停止。 在TopiOCQA与QReCC上以BM25为检索器、与五个训练式改写基线在同一评测划分和指标下比较,并复现了ConvSearch-R1的发布权重与分数。
完整的多步多动作智能体在TopiOCQA上达到MRR 41.4、NDCG@3 40.6,在QReCC上达到MRR 57.2、NDCG@3 55.8,均为对比方法中最高,且增益集中在排序顶部。 单步单动作配置复现了ConvSearch-R1的水平,单步多动作反而下降,说明增益来自迭代与类型化动作的组合,而非骨干模型或动作空间本身。 受控配置逐一隔离骨干、动作空间与迭代;迭代优势在监督微调后并不存在,只在强化学习对齐检索器后出现。
仅靠检索奖励优化,策略自发收敛出一致动作顺序:先做意图解析,再可选地做词汇改写,最后生成以先前检索段落为条件的伪文档。 该顺序既未被提示词规定也未被奖励编码,监督微调轨迹平均仅1.7步且只有60%以意图解析开头,强化学习后这些替代开头消失、回合延长至TopiOCQA 4.9步、QReCC 2.9步。 伪文档的8-gram包含度中位数为0,说明并非逐字复制段落;其与上下文段落的去停用词unigram Jaccard均值为0.137,而无关查询上下文为0.014;把上下文替换为无关查询段落会使TopiOCQA的NDCG@3从40.6降到25.3。
策略可零样本迁移到TREC CAsT 2019/2020,并在推理时更换检索后端仍然有效。 TopiOCQA训练的模型在CAsT两年份的NDCG@3上均超过ConvSearch-R1;在TopiOCQA上换成ANCE与Qwen3-Embedding-0.6B后各指标均优于BM25。 迁移评测不做额外训练;QReCC上稠密检索器未超过BM25,与既有工作报告BM25在该基准领先一致,说明绝对表现仍取决于检索器与数据集的匹配度。
启示与展望
该结果面向以段落相关性标签为监督、以现成检索器为接口的会话检索场景:训练与主评测在TopiOCQA和QReCC上进行,CAsT仅用于零样本评测,检索器在全部实验中均未被训练或适配。方法适用于需要把上下文依赖的用户轮次转成独立查询、且可接受多轮检索开销的会话系统;作者指出,把步数惩罚或延迟成本纳入奖励,可能得到在会话歧义较低时提前终止的成本感知策略,而在每步并行发出多个改写并按融合排序给奖励,则可能以更短的序贯循环扩大召回。
读者仍需关注若干开放问题:迭代优势只在强化学习后出现,其可复现性依赖SFT蒸馏与GRPO的具体配置;伪文档接地以8-gram包含度与unigram Jaccard衡量,是否完全排除平凡重排仍值得进一步检验;序贯交互的累计生成成本随数据集变化,TopiOCQA上93%的轨迹发出第五次改写而QReCC仅4%,成本与收益的权衡尚未纳入奖励;QReCC上稠密检索器未超过BM25,说明迁移效果与检索器—数据集匹配度相关。此外,正文中的公式与部分符号在解析文本中缺失,若需复现训练细节应查阅原文附录。
