长上下文LLM整池集合式重排:DualEnd用50次比较完成100个候选的完整排序,比较次数比窗口式堆排序基线少59.4%
相关研究与后续进展核心概要
该工作提出整池集合式重排(Whole-Pool Setwise),让每次比较对整个候选池排序,并提出DualEnd同时选出预测最相关与最不相关的候选、从两端填充排名,从而在100个候选上仅用50次LLM比较即构建完整排序;在TREC DL19与DL20上使用九个开放权重LLM,比较次数比面向顶部的窗口式Setwise堆排序少59.4%、比冒泡排序少88.8%,nDCG@100与单端整池顶部导向方法相差在0.008以内,同时token消耗与排序时间约减半;在六个BEIR数据集上,相对单端整池顶部导向方法,平均token消耗与排序时间分别降低49.4%与50.8%。
Figure 1: One LLM comparison in (a) windowed Setwise, (b) WP-T and (c) WP-DE. Dashed boxes mark input candidates, blue and orange indicate predicted best and worst candidates. Windowed selections require sorting, Whole-Pool selections fix one or both endpoints through swaps.
arXiv深度剖析
提出整池集合式重排(Whole-Pool Setwise):当整个检索候选池能放入上下文窗口时,每次比较直接对整个候选池排序,而不是做重复的局部比较。 此前的LLM重排器通过listwise、pairwise或pointwise的重复局部比较产生排名,需要大量顺序模型调用;该工作把比较粒度提升到整池,利用长上下文能力压缩调用次数。 摘要给出方法定义与实验设置:九个开放权重LLM、TREC DL19与DL20、六个BEIR数据集,并报告比较次数、nDCG@100、token消耗与排序时间的对比数值。
提出DualEnd:在整池比较中同时选出预测最相关与最不相关的候选,从排名两端同时填充。 相对单端、面向顶部的整池方法,DualEnd把选择范围扩展到池的两端,从而在构建完整排名时减少所需比较次数。 摘要报告DualEnd在100个候选上以50次LLM比较构建完整排序,并给出与单端整池顶部导向方法的nDCG@100差距在0.008以内、token消耗与排序时间约减半。
在TREC DL19与DL20上,DualEnd的比较次数显著低于面向顶部的窗口式Setwise基线,且基线只针对top-10排名而DualEnd针对完整排名。 比较次数比窗口式Setwise堆排序少59.4%、比冒泡排序少88.8%,说明整池双端策略在更完整的排序目标下仍大幅降低顺序调用。 摘要明确给出上述百分比,并说明基线仅面向top-10、DualEnd面向完整排名,构成对比较条件的直接说明。
在六个BEIR数据集上,DualEnd相对单端整池顶部导向方法平均降低token消耗49.4%、排序时间50.8%。 把效率收益从TREC集合扩展到BEIR多数据集,并给出跨数据集的平均token与时间降幅。 摘要报告六个BEIR数据集上的平均token消耗与排序时间降幅,并称在多个backbone上效果具有竞争力。
启示与展望
该结果适用于整个检索候选池能够放入长上下文窗口的场景,方法本身以这一前提为条件;实验覆盖TREC DL19与DL20以及六个BEIR数据集,并使用九个开放权重LLM作为backbone。对希望以更少顺序LLM调用获得完整排名的检索系统开发者,DualEnd提供了从两端填充排名的具体路径;对只关心top-10排名的场景,摘要中的窗口式Setwise基线是更贴近的对照。
摘要未说明各数据集上的逐项nDCG@100数值、比较次数的方差或显著性检验,也未展开DualEnd在候选池超出上下文窗口时的行为;这些属于正文可能回答的开放问题。若只依据摘要,读者无法判断不同backbone之间的差异幅度,也无法确认BEIR上效率收益是否伴随效果变化。
