跳到主要内容
返回时间线
arXiv来源发表:

CLIMB以置信度引导的互补证据池改进多模态RAG,在Encyclopedic-VQA与InfoSeek上稳定超越检索增强基线

相关研究与后续进展

核心概要

作者提出免训练、推理期的多模态RAG框架CLIMB:先用MMR式目标构建兼顾查询相关性与段落冗余度的紧凑互补证据池,再用R/E/C评论器按相关性、证据特异性与跨模态对齐打分,并由证据接地的置信度估计器仅在置信度上升时接受更新答案,从而提供简单停止准则;在Encyclopedic-VQA与InfoSeek上一致优于检索增强的多模态基线,消融显示互补池、评论器打分与迭代置信控制细化各有贡献。

Source-provided article image: CLIMB: Confidence-Guided Complementary Evidence for Multimodal Retrieval-Augmented Generation
Figure 1 ·

Figure 1: Comparison of multimodal RAG approaches. (a) Standard methods Cocchi et al. (2025) ; Caffagni et al. (2024b) ; Yan and Xie (2024) rely on Top-K similarity selection, which often produces redundant evidence with limited coverage and lacks explicit quality control for answer generation. (b) Our CLIMB framework addresses these limitations through two key innovations: diversity-aware evidence construction that balances relevance and complementarity to build a non-redundant passage pool, and confidence-controlled decoding that uses multi-faceted scoring and monotonic confidence constraints to ensure reliable answer updates.

arXiv

深度剖析

CLIMB是一个免训练、推理期的多模态RAG框架,不修改底层检索器与MLLM,即可在知识密集型视觉问答中引入外部文本证据。 相对依赖Top-K检索或重排序的既有系统,CLIMB把改进放在推理流程而非模型或检索器训练上,降低了部署改动面。 论文摘要明确说明该框架为training-free inference-time,且不修改underlying retriever or MLLM;具体实现细节在摘要层面未展开。

CLIMB用MMR式目标构建紧凑的互补证据池,在查询相关性与段落级冗余度之间取得平衡。 针对Top-K检索可能返回冗余段落的问题,该方法以互补性而非单纯相关性组织证据集合。 摘要给出该目标的设计意图;消融显示complementary pooling对最终性能有贡献。

CLIMB在固定证据池内做置信度控制的细化:R/E/C评论器按相关性、证据特异性与跨模态对齐为段落打分,证据接地的置信度估计器仅在估计置信度上升时接受更新答案。 相比缺乏对答案更新是否被证据充分支持的控制,该设计提供了简单停止准则并减少不必要的细化迭代。 摘要描述该机制并指出其提供stopping criterion;消融显示critic-based scoring与iterative confidence-controlled refinement各自有贡献。

在Encyclopedic-VQA与InfoSeek上,CLIMB一致优于检索增强的多模态基线。 在两个知识密集型视觉问答基准上给出相对既有检索增强基线的稳定提升。 摘要报告consistent improvement;具体数值、样本规模与统计检验未在摘要中给出。

启示与展望

该工作面向知识密集型视觉问答场景,适用于已有检索器与多模态大模型、希望在不重训的前提下改进证据使用与答案更新的团队;其设计意图是在固定证据池内做置信度控制的细化,并以置信度上升作为停止条件。摘要层面的证据来自Encyclopedic-VQA与InfoSeek两个基准及组件消融,因此其适用范围应理解为这类需要外部文本证据的视觉问答设定。

摘要未报告具体性能数值、样本规模、检索器与MLLM的具体配置,也未说明置信度估计器的实现方式与阈值设定;R/E/C评论器各维度的权重与互补池规模等超参数在摘要中不可见。若读者需要判断提升幅度与统计稳健性,仍需查阅正文的表格与实验设置。

来源