EscapeGuard 在六基准六模型上将工具选择幻觉降低 9.0 个百分点并抑制跨配置幻觉逃逸
相关研究与后续进展核心概要
该工作识别并形式化定义了“幻觉逃逸”:现有工具幻觉缓解方法在其调优的工具配置上降低幻觉,却在其他配置上增加幻觉;作者发现模型存在内在工具使用倾向,与运行时配置冲突时幻觉急剧上升,而现有方法反而强化这些倾向;据此提出免训练推理时方法 EscapeGuard,通过冲突感知门控与配置导出的注意力增强,在六个基准与多种模型上将工具选择幻觉降低 9.0 个百分点,跨配置均值下降 23.7 个百分点,配对查询净提升 89.1%。
Figure 1: Hallucination escape and repair. (a) Under the standard configuration ( C 1 C_{1} ), an existing mitigation method produces the correct call. (b) After the tool is renamed ( C 2 C_{2} ), the same method still calls the original name. (c) EscapeGuard adapts to the renamed configuration and produces the correct call.
arXiv深度剖析
识别并形式化定义了“幻觉逃逸”这一此前被忽视的失效模式:缓解方法在调优配置上降低幻觉,却在其他配置上增加幻觉,且增幅足以抵消收益。 此前工作只在各自调优的单一工具配置下评估改进,未考察跨配置泛化;本文沿工具配置变化与查询变化两个维度评估五种现有方法,发现全部满足逃逸定义。 在 LLaMA-3.1-8B-Instruct 与 Qwen-3.5-9B 上复现五种方法(Relign、PALADIN、Gorilla、LinSteer、PRISMS),使用 BFCL V3 与 Seal-Tools 约 1,000 条查询、六种配置、三个随机种子;五种方法在调优配置平均降低 7.5 个百分点,在其余五种配置合计增加 13.0 个百分点,跨配置均值均高于基座模型。
揭示幻觉逃逸的机制:模型在无运行时工具配置时仍表现出稳定的内在工具使用倾向,当倾向与当前配置冲突时幻觉随倾向强度单调上升,而现有方法强化了这些倾向。 将幻觉来源从“配置外分布”推进到“内在倾向与运行时配置的冲突”,并用逐层探针在表示空间验证该冲突可分离且与幻觉相关。 闭卷诱导显示选择先验均值 0.61–0.78、用法先验 0.57–0.71;冲突条件下幻觉随先验强度五分位单调上升,选择与参数名相关性最强;逐层逻辑回归探针检测冲突准确率 85%–87%(选择)与 77%–79%(参数名),预测幻觉 AUROC 0.81–0.84 与 0.74–0.75;现有方法使先验强度增加 0.04–0.14,逃逸比最高达 2.42。
提出免训练推理时方法 EscapeGuard,在检测到倾向冲突时把注意力重定向到运行时工具配置,从而在降低工具幻觉的同时抑制幻觉逃逸。 与训练式或固定方向干预不同,EscapeGuard 的纠正信号来自当前工具配置而非固定倾向,可随工具改名、替换与模式变化自然适配,且不改变模型内在先验。 在六个基准与六个骨干模型上,工具选择幻觉降低 4.3–14.7 个百分点(总体 9.0 个百分点),参数名幻觉相对降低最多 67%;跨配置均值下降 23.7 个百分点,方差下降约 40%,配对查询净提升 87.8%–90.4%;推理开销为基座延迟的 4%–6%。
启示与展望
该结果面向使用外部工具的单轮工具调用场景,适用于工具名称、描述与参数模式可能随部署变化的运行时环境;EscapeGuard 以冻结的冲突探针为门控,仅在冲突分数超过阈值时干预,因此适合希望在不重训模型的前提下提升工具调用可靠性的工程团队。方法在六个基准(BFCL、Seal-Tools、RelyToolBench、API-Bank、MetaTool、APIBench)与六个骨干模型上验证,跨配置评估覆盖标准、工具替换、描述改写、参数改名、混合改动与干扰项注入六种配置,并给出配对查询的修复率、迁移损害率与净提升,便于读者按自身工具配置变化程度判断适用性。
倾向冲突机制对参数值幻觉的解释较弱,EscapeGuard 在参数值幻觉上的改善也相应有限,残余总体幻觉主要由参数值错误主导;干扰项注入配置下增益最小,作者推测是易混工具稀释了增强的注意力信号。探针在表面形式新颖性匹配的对照下仍保留预测力,但作者指出要完全排除各类分布偏移作为混杂,需要在固定配置下干预倾向强度,这在预训练模型中并不直接可行。此外,六种工具配置与所测架构虽具代表性但并非穷尽,扩展到更广架构与提升干扰项鲁棒性仍是开放方向。
