RED 免训练解码方法在三个音视频幻觉基准上把准确率最高提升 7%,首 token 时间约为标准解码的 1.5 倍
相关研究与后续进展核心概要
该工作提出免训练的 Relevant Evidence Decoding(RED),用逐点互信息把音视频联合预测拆分为音频、视频与残差交互三部分,并通过仅问题推理判断所需证据类型后只增强对应贡献;在三个音视频幻觉基准与三个 AV-LLM 上,RED 相对标准解码最高提升 CMM 7%、AVHBench 6.3%、SVHalluc 3.8%,平均首 token 时间约为标准解码的 1.5 倍。
Figure 1: Motivation of this study. (a) A correct prediction does not necessarily indicate successful hallucination mitigation. (b) When question-required evidence changes, the prediction should change accordingly. (c) When non-required evidence changes, it should remain unchanged. The base model violates both behaviors, whereas RED follows the evidence required by the question.
arXiv深度剖析
论文指出音视频联合推理可能削弱预测:即使单一模态已能给出正确答案,加入另一模态后置信度仍可能下降,例如仅凭音频可正确回答听到的小提琴,加入显示吉他的视频后对 violin 的置信度下降。 此前对比解码主要针对视觉语言模型,直接迁移到 AV-LLM 时忽略了不同问题需要不同感知证据(音频、视频或二者交互)这一关键挑战。 该观察以具体问答示例形式在摘要中给出,属于动机性说明,未报告统计量或样本规模。
RED 用逐点互信息量化音频与视频在问题之外提供的预测支持,并把联合贡献分解为音频、视频与残差交互三个分量。 与直接套用对比解码不同,RED 显式区分证据来源,使增强作用于与问题相关的模态分量。 方法描述为免训练,摘要给出 PMI 分解与仅问题推理两步流程,未提供实现细节或消融数据。
RED 先做一次仅问题推理以确定所需证据类型,再把对应的 PMI 贡献加到原始音视频预测上。 该选择机制把“问题需要哪种证据”作为解码的前置判断,而非对所有模态统一加权。 摘要说明流程顺序,未报告该判断本身的准确率或失败情形。
在三个音视频幻觉基准与三个 AV-LLM 上,RED 相对标准解码最高提升 CMM 7%、AVHBench 6.3%、SVHalluc 3.8%,平均首 token 时间约为标准解码的 1.5 倍。 结果覆盖多基准与多模型,并同时报告了推理延迟代价,便于权衡精度与效率。 摘要给出基准名称、模型数量与提升幅度及相对延迟,未给出逐模型细分或显著性检验。
启示与展望
该工作面向音视频大语言模型的跨模态幻觉缓解,适用于需要从音频、视频或二者交互中选取证据的音视频问答场景,并以免训练方式在解码阶段接入现有 AV-LLM。受益者包括研究多模态幻觉与解码策略的研究者,以及希望在不大规模重训的前提下降低音视频幻觉的工程实践者。结果以三个音视频幻觉基准(CMM、AVHBench、SVHalluc)与三个 AV-LLM 为评估范围,延迟以平均首 token 时间约 1.5 倍标准解码为参照。
读者仍需关注:仅问题推理判断证据类型的可靠性在何种问题上会失效;PMI 分解中残差交互分量在何种情形下占主导;1.5 倍首 token 时间在长输出或实时场景中的实际影响;以及提升幅度在不同 AV-LLM 之间的分布是否一致。本次可获取文本为摘要级内容,缺少图表、逐模型结果与消融细节,因此上述问题无法从现有材料中确认,属于后续阅读原文时的开放问题。
