跳到主要内容
返回时间线
arXiv来源发表:

RAG-Stress 诊断协议:要求模型优先信任文档会使正确答案被证据支持的错误答案替换,Strict 比 Soft 的误导率高出 10.9–13.5 个百分点

核心概要

RAG-Stress 提出一种受控诊断协议:固定问题与参考答案,只修改证据中一处断言使其支持指定错误答案,并将两种来源优先策略与答案片段在证据文本中的三种位置交叉,在十五个系统、三个问答数据集及中英文医学问答上测量“误导率”(仅统计无检索时原本答对的题目)。结果显示,要求优先信任文档的指令在各系统与数据集上一致地产生更高误导率,跨三个数据集平均差距为 10.9–13.5 个百分点,且按模型平均的误导率在两种指令下均呈“末尾>开头>中间”的顺序。

Source-provided article image: RAG-Stress: Probing the Limits of Evidence Reliance in Retrieval-Augmented Generation
Figure 1 ·

Figure 1: One saved trajectory: the same edit, two instructions, different answers. With clean evidence, both soft and strict prompting return the reference (Tomb Raider); with the edited evidence, soft prompting keeps the reference while strict prompting adopts the foil (Uncharted). The closed-book answer is also Tomb Raider.

arXiv

深度剖析

该工作提出以“无检索时是否答对”为条件来测量指定错误答案(foil)的采纳率,即误导率(MR),从而把“答案被替换”与“原本就答错”区分开。 既有评估多关注检索是否提升准确率或答案是否被检索文本支持,而聚合准确率会把答案替换与既有错误混在一起;RAG-Stress 固定问题与参考答案,只编辑一处含答案的断言使其支持同类型的 foil,并在基线答对的子集上计分。 协议在十五个系统(七个 API 系统、四个开源指令模型、四个 RL 训练搜索代理)与 TriviaQA-RC、HotpotQA、SearchQA 上执行,另有中英文 MedQA 各 1,000 题;干净证据准确率在全量准备集上计算,MR 在各模型基线答对子集上计算,两者分母不同且不相减。

来源优先策略(Strict 要求以文档为主要真相来源,Soft 允许先验知识覆盖冲突文档)系统性地改变误导率:Strict 的 MR 在主表每个报告单元中都高于 Soft。 该对比在问题、证据与位置固定的条件下只改变来源优先策略,因此差距与“依赖证据的行为随策略变化”一致,而非检索内容不同;其方向符合指令预期,诊断价值在于基线答对答案中被指定 foil 替换的频率。 跨三个 QA 数据集、按模型与位置平均的差距为 10.9–13.5 个百分点;中英文 MedQA 上全部 15 个系统的 Strict MR 均高于 Soft MR,组平均差距相近(API 12.8 对 12.4,开源 16.9 对 18.3,RL 9.8 对 9.3)。

答案片段在证据文本中的位置与误导率相关:按十五个模型等权平均,两种指令下三个数据集均呈“末尾>开头>中间”。 长上下文中的位置效应此前多被用于动机性讨论,而未直接检验文档内答案片段位置;该工作将 Word Position 作为交叉条件之一,并另做 300 题配对位置检验。 Strict 下各位置 MR 为 TriviaQA-RC 37.0/31.4/30.3%、HotpotQA 41.3/35.8/32.8%、SearchQA 35.0/29.3/26.9%;配对检验中 Strict 下“末尾减中间”对 A/B 两模型分别为 10.9 与 9.6 个百分点,而“开头减中间”及全部 Soft 对比的区间包含零,因此支持 Strict 下末尾 MR 更高,而非完整排序或已检验的指令–位置交互。

独立的配对审计(500 题、两个量化 8B 检查点、13,000 条生成)显示 Strict 相对 Soft 增加了有害覆盖,但未确立有益纠正的相应提升。 该审计把有害覆盖(HOR)、有益纠正(BCR)与干净到编辑证据的转变分开报告,并保留全部重复单元按问题做自助法估计不确定性,从而把“遵从来源策略”与“事实可靠性”区分开。 Strict 相对 Soft 在基线答对子集上使 foil 采纳增加 14.0 与 9.7 个百分点,两个检查点的 HOR 对比区间均不含零,而对应的 BCR 区间均包含零;干净证据下指定 foil 匹配率接近零(Strict 0.0%,Soft 0.0–0.3%),编辑臂则高得多。

启示与展望

该协议面向需要评估检索增强系统在证据与先验知识冲突时行为的读者,适用于证据固定、问题与参考答案固定、且可建立无检索基线答对层的问答设定;作者指出这测量的是行为转变,而非稳定的参数化知识或编辑本身的因果效应。主干预在目标证据文本内改变答案片段位置并固定文档顺序,而独立审计移动整段目标文档到第 1、2、4 个文档槽,其位置对比描述的是文档顺序而非文本内词位置。中英文 MedQA 使用不同题目而非配对翻译,因此语言差异与闭卷覆盖率共变,属描述性。作者也说明该工作不识别内部注意力机制,也不提出更优的缓解方法。

读者仍需关注若干开放问题:主表十五个系统的对比为描述性,配对自助法区间只用于 300 题 QA 检查与 500 题审计,且未做多重比较校正;位置对比支持 Strict 下末尾 MR 更高,但完整排序与指令–位置交互尚未确立;HotpotQA 上更高的 MR 与多跳推理链机制一致,但证据风格、难度与基线答对队列同时不同,需匹配的桥接与终端编辑才能检验;审计中 HOR 区间不含零而 BCR 区间含零,并不构成两者差异的检验,也不证明 BCR 效应恰为零;审计的语义有效性人工复核字段仍为空,其来源是历史 Llama 选定的 1,000 题池,泛化受限;解码配置检查为描述性一致性检查,未隔离采样或输出长度效应。

来源