Seek 用测试时迭代检索让 Qwen2.5-7B 在 BRIGHT 上相对 BM25 提升 82%,GPT-4.1 达 37.4 nDCG@10
核心概要
该工作提出 Seek——一个免训练的自评估探索式检索框架,通过在测试时进行多轮语料交互(LLM 依据累积的相关性反馈生成伪段落、检索器给出新候选、专门的评估器给出分级相关性判断以指导后续轮次),在 TREC Deep Learning 上排名质量与训练过的重排器相当并持续提升 Recall@100,在 BRIGHT 上 Qwen2.5-7B 相对 BM25 取得 82% 的相对增益并超过所有训练基线,GPT-4.1 达到 37.4 的平均 nDCG@10、超过最强基线 37%。
Figure 1. Overview of Seek . Each round generates feedback-conditioned pseudo-passages, retrieves fresh candidates, and assigns graded relevance judgments that inform subsequent generation.
arXiv深度剖析
Seek 是一个免训练框架,通过测试时的迭代语料交互来缓解单次检索的不可恢复问题。 既有 LLM 检索器与重排器都只与语料交互一次并锁定候选集,一旦漏掉相关文档便永久无法找回;Seek 把交互改为多轮循环。 摘要层面的方法描述,未提供轮次上限、停止条件或计算开销等实现细节。
每一轮由 LLM 基于累积的相关性反馈生成伪段落,检索器据此浮现新的候选,再由专门的评估器给出分级相关性判断来引导下一轮。 把“生成—检索—评估”组成闭环,用分级判断而非二值信号驱动探索方向。 摘要给出的组件级说明,评估器如何训练或提示、分级判断的粒度均未在可见文本中展开。
在 TREC Deep Learning 上,Seek 的排名质量与训练过的重排器相当,并相对单次 BM25 持续提升 Recall@100。 免训练方法在排名质量上追平需要训练的重排器,同时把召回提升作为稳定收益。 摘要报告的结果陈述,未给出具体 Recall@100 数值、对比的重排器名称或显著性检验。
在推理密集的 BRIGHT 基准上,Seek 搭配 Qwen2.5-7B 相对 BM25 取得 82% 的相对增益并超过所有训练基线;搭配 GPT-4.1 达到 37.4 平均 nDCG@10,超过最强基线 37%。 把免训练迭代检索的收益从常规段落排序扩展到推理密集型检索,并在该设定下超过训练基线。 摘要给出的两个具体数字(82% 相对增益、37.4 nDCG@10 与 37% 超出),但未说明基线集合、数据集子集或方差。
启示与展望
该结果面向信息检索研究与系统实践者,适用于希望在测试时用额外算力换取召回与排名质量、且不愿承担重排器训练成本的场景;摘要明确其定位是免训练框架,并在 TREC Deep Learning 与 BRIGHT 两个基准上给出证据,因此结论的适用范围应理解为这两类评测设定。对读者而言,这意味着可以把 Seek 视为一种“测试时迭代探索”的检索策略模板,用于考察多轮交互是否值得替代单次检索加训练重排的组合。
可见文本仅为 arXiv 摘要页,缺少正文、图表与实验细节,因此无法判断 82% 相对增益与 37.4 nDCG@10 所对应的基线集合、数据集子集与方差;迭代轮数与延迟开销、评估器分级判断的可靠性、以及免训练设定在不同语料规模下的表现,都是读者需要回到原文确认的开放问题。
