ARR 让多模态检索器用检索到的条目迭代改写查询,在 M-BEIR 与七个零样本基准上取得最高平均分
核心概要
作者提出自回归检索器 ARR:它在多模态检索中交替执行“检索一个条目”和“更新查询嵌入”,把选中条目的多模态内容追加到查询历史后再编码,用最终嵌入对语料排序;训练分两阶段,先用逐步对比监督的监督微调教会编码器解读反馈,再用强化学习把反馈条目当作动作、以相关条目最终倒数排名为奖励优化选择,并通过查询侧适配器在固定条目索引上完成优化。
Figure 1: Autoregressive retrieval with ARR. Retrieved items provide context for successive query embeddings; the final embedding ranks the collection.
arXiv深度剖析
ARR 把检索过程本身变成自回归序列:每一步按嵌入相似度选出一个条目,把其内容与元数据追加到查询上下文,再编码得到下一个查询嵌入,最终嵌入用于排序整个集合;条目嵌入仍独立编码,因此保留预计算索引的检索接口。 以往通用多模态检索把查询编码一次后固定不变,检索反馈通常交给辅助改写或精排模块处理;ARR 让检索器自身消费并选择反馈条目,且历史掩码只作用于反馈选择,已选条目在最终检索中仍可被召回。 论文给出状态与策略的形式化定义(式 3–5),并在 M-BEIR 与七个零样本基准上报告结果;消融显示未训练使用反馈的模型把推理步数从 1 增到 4 时平均分从 55.23 降到 46.90,说明反馈使用需要学习。
两阶段训练把“解读反馈”和“选择反馈”分开:SFT 在离线轨迹上用逐步对比监督,并对相邻状态间对比损失的相对上升施加退化惩罚;RL 冻结 SFT 主干、只训练查询侧 LoRA,用 GRPO 风格目标以相关条目最终倒数排名为奖励优化条目选择,并在最终状态加对比监督。 SFT 的对比损失只监督每个状态,不把信用分配给动作;ARR 的 RL 动作空间是检索到的条目身份而非生成的文本 token,奖励直接来自最终排名,因此能偏好未被标注为正例但对后续检索有用的中间条目。 消融显示去掉退化惩罚后初始分几乎不变(55.69 对 55.63)但反馈增益消失(终分 55.68 对 56.01);去掉 GRPO 后终分降到 55.29,低于完整 RL 模型与其 SFT 初始化;去掉最终嵌入对比损失为 56.43,仍高于 SFT 的 56.01。
在 M-BEIR 域内评测中,ARR-RL 在 2B 与 8B 两个规模上都取得所比较方法中的最高平均分,分别为 56.7 和 61.0;8B 下比最强基线 TRACE 的 58.8 高 2.2 分,RL 相对 ARR-SFT 分别提升 0.7 和 1.2 分。 增益集中在需要跨信息结构连接的配置上:8B 模型 RL 把 EDIS 文本到多模态召回从 66.8 提到 73.2,把 OVEN 多模态到文本召回从 58.7 提到 63.5;同时论文指出 VisualNews(2B)与 CIRR(两个规模)等少数配置略有下降。 结果来自 M-BEIR 16 个数据集–任务组合的本地候选池设置,并与 MM-Embed、LamRA-Ret、TRACE、ELVA 对比;RL 阶段从 16 个组合各采样 2K 查询共 32K 查询,候选池由 SFT 模型 top-100 加标注正例构成。
零样本评测中 8B 的 ARR-RL 取得最高报告平均分 79.01,高于最强基线平均 74.10,并在 Visual Dialog 得 77.9、Multi-round FashionIQ 得 66.0,显示向对话与交互式检索的迁移;两个训练阶段的模型都从推理期反馈中获益。 论文把反馈的两种收益分开:推理时使用反馈改善后续检索(ARR-SFT 从 77.95 到 78.39,ARR-RL 从 78.42 到 79.01),而训练中学习反馈还改善初始查询嵌入——在未观察任何反馈前,ARR-SFTN=4 比 ARR-SFTN=1 高 0.40 分。 零样本评测覆盖 ShareGPT4V、Urban-1K、Flickr30K、CIRCO、GeneCIS、Visual Dialog、Multi-round FashionIQ 七个基准且不做任务特定微调;论文同时说明部分基准复用 COCO 或 FashionIQ 图像,因此该协议不意味着全部视觉内容未见。
启示与展望
该工作面向通用多模态检索场景:查询与条目可为文本、图像或二者组合,评测覆盖 M-BEIR 的新闻、时尚、维基与综合内容四个领域,以及七个零样本基准。方法设计为在固定条目索引上工作,RL 只更新查询侧 LoRA 适配器,因此适合已有预计算条目嵌入、希望在不重建索引的前提下提升查询理解的检索系统。论文报告 Iter-2 在测试时计算与性能之间较为平衡,并指出训练与推理默认使用四步反馈;对需要多轮交互或对话式检索的场景,Visual Dialog 与 Multi-round FashionIQ 的结果提供了参考。
论文报告少数任务配置略有下降(2B 的 VisualNews、两个规模的 CIRR),并推测可能与 RL 在相对较小数据子集上密集训练带来的任务偏差有关,这一解释尚待进一步验证。反馈增益在 Iter-2 之后趋于平缓,四状态训练相对两状态在 Iter-4 仅高 0.10 分,因此更多推理步数的收益边界仍需在更多任务上观察。零样本协议中部分基准复用 COCO 或 FashionIQ 图像,全部视觉内容是否未见并不确定。此外,退化惩罚被描述为“鼓励但不保证”反馈后排名改善,其在不同数据分布下的稳健性仍是开放问题。
