跳到主要内容
返回时间线
arXiv来源发表:

CIM 通过因果不变掩码分解 MLLM 不确定性,EED 代理指标在近乎 50% 加速下保持可比性能

相关研究与后续进展

核心概要

该工作针对多模态大模型(MLLM)幻觉问题提出不确定性量化方法 Causal-Invariant Masking(CIM),通过测量原始预测与因果聚焦视图下预测之间的语义偏移来分解不确定性类型,并给出核心指标 Semantic Divergence 及理论证据说明其收敛于模型对非因果相关性敏感度的方差,同时提出快速几何代理指标 Expected Embedding Drift(EED),实验显示方法在多个基准上达到 state-of-the-art,EED 在性能可比的情况下加速近 50%。

Source-provided article image: Revealing Epistemic Uncertainty in MLLMs via Causal-Invariant Masking
Figure 1 ·

Figure 1: Left: A case of blurred and background-mixup image pair. Middle: Sensitivity of Semantic Entropy to visual perturbations in MLLMs. Similar levels of error to the original image are binned into the same point. Right: Comparison of uncertainty increase under blurring and background mixup perturbations. While Semantic Entropy increases slightly across both, it fails to distinguish hallucination. In contrast, our proposed Semantic Divergence remains robust to visual blur but exhibits a distinct spike under hallucinative perturbations. The values are normalized by the standard deviation of each metric.

arXiv

深度剖析

提出 Causal-Invariant Masking(CIM)框架,通过比较原始预测与在因果聚焦视图条件下得到的预测之间的语义偏移来量化不确定性,从而将不确定性分解为不同类型以支持更全面的 UQ。 现有方法偏向由数据歧义引起的 aleatoric uncertainty,在查询相关信号较弱时难以检测由表层关联引发的不确定性;CIM 转向刻画源自模型局限的 epistemic uncertainty。 摘要层面给出框架设计与动机,未在可见文本中提供具体数据集、样本量或消融细节。

提出 Semantic Divergence 作为 UQ 核心指标,并提供理论证据表明其收敛于模型对非因果相关性敏感度的方差,从而建立其捕捉 MLLM 局限的能力。 将不确定性度量与因果视角下的敏感度方差建立理论联系,而非仅依赖经验性打分。 摘要声明有理论证据支撑收敛性,但可见文本未展示证明细节或假设条件。

提出 Expected Embedding Drift(EED),一种在超球嵌入空间中直接估计语义偏移的快速几何代理指标,用于加速 MLLM 的 UQ。 以几何代理替代完整语义偏移计算,在保持性能可比的前提下降低计算开销。 摘要报告 EED 加速近 50% 且性能可比,未给出具体基准名称或数值表。

实验显示该方法在多个基准上取得 state-of-the-art 性能。 在多种评测设置下优于既有 UQ 方法。 摘要层面的总体结论,未列出基准清单、对比方法与统计量。

启示与展望

该工作面向需要可靠部署的多模态大模型场景,尤其是查询相关信号较弱、表层关联容易诱发幻觉的情形;其目标是提供可分解的不确定性信号,使实践者能够在推理阶段区分数据歧义与模型局限所导致的不确定性。EED 作为几何代理指标,适用于需要在超球嵌入空间中快速估计语义偏移、且对计算开销敏感的大规模推理或在线监测设置。

可见文本为摘要级信息,未包含具体基准名称、对比方法、样本规模、消融实验与理论证明的假设条件,因此无法判断 state-of-the-art 结论的适用范围与稳健性;EED 的“性能可比”缺少量化定义,加速近 50% 的测量条件(硬件、批大小、模型规模)也未说明;Semantic Divergence 收敛性所依赖的因果假设是否在实际多模态数据上成立,仍是需要进一步观察的开放问题。

来源