SECRET 在问题中继处拦截跨模态干扰,使音视频大模型在 CMM 上最高提升 18.0 个百分点
核心概要
该工作通过路径干预与表征分析发现音视频大语言模型存在“问题中继”机制——问题位置的隐状态同时承载所需模态证据与干扰模态线索,据此提出免训练方法 SECRET,用源条件化的正负问题表征对比来引导问题状态偏向所需模态证据,在 CMM 与 AVHBench 两个基准、三个音视频大模型上均取得优于既有免训练方法的准确率,最高较基座模型提升 18.0 和 7.1 个百分点,并在模态特定描述任务上降低干扰项重叠。
深度剖析
论文识别出“问题中继”机制:问题 token 位置的隐状态既传递所需模态证据,也把干扰模态线索带入答案预测,从而造成源混淆的接地幻觉。 此前研究多在生成位置考察模态依赖,或通过推理时纠错解码与训练时对齐来缓解该失败,但对其内部跨模态交互如何产生仍理解不足;该工作把分析焦点移到问题状态这一中间环节。 基于 AVHBench 的 Video-Driven Audio Hallucination 与 Audio-Driven Video Hallucination 子集做注意力路径切割与表征分析:切断所需模态到问题状态的路径会降低源忠实样本的正确答案支持,切断干扰模态到问题状态的路径可部分恢复源混淆样本的正确答案支持,且问题位置干预带来的正确答案 logit 恢复大于生成位置干预;窗口大小改为三层、五层时结论方向保持一致。
论文提出免训练方法 SECRET,通过源条件化的问题表征对比进行中继引导,在不改动音视频输入的前提下抑制跨模态干扰。 与扰动或移除模态输入的做法不同,SECRET 通过内部注意力路径干预构造正负问题表征,保留完整音视频上下文;与在生成位置干预的既有思路不同,它把干预点放在问题 token 位置。 方法先用纯文本问题让模型预测所需模态,再分别切断干扰模态与所需模态到问题状态的路径,得到正、负参考表征,并按 L2 范数匹配后以逐 token 差值更新原始问题状态,仅在 prefill 阶段施加引导;消融显示去掉范数匹配会降低两个模型上的准确率,生成位置干预变体与模态移除变体的表现均低于 SECRET。
在 CMM 与 AVHBench 上跨三个音视频大模型评测,SECRET 一致优于所比较的免训练方法,整体准确率较基座模型最高提升 18.0 与 7.1 个百分点。 评测覆盖不同规模与稠密、混合专家两类架构,并在两个数据集上同时验证,说明由 AVHBench 分析得出的问题中继引导具有跨数据集适用性。 CMM 使用 visual-dominance 与 audio-dominance 共 800 题,AVHBench 两个子集共 3,426 个问答对;对比对象包括 VCD、AVCD、MAD 等免训练方法。提升随所需模态而异:VideoLLaMA2-AV-7B 与 Qwen2.5-Omni-7B 在音频所需任务上提升更大,Qwen3-Omni-30B-A3B 在视频所需任务上受益更多。
在音频-视频不匹配输入下的模态特定描述任务中,SECRET 取得最低的 D-CIDEr 与最高的 LLM-score,同时保持有竞争力的 T-CIDEr,说明其可推广到开放式生成。 主结果集中在判别式问答基准,该实验把源接地能力延伸到开放式描述,并同时用目标一致性与干扰项泄漏两类指标衡量。 沿用 ACPO 的评测设置,音频目标与视频目标描述各 400 个音频替换样本;D-CIDEr 越低表示与干扰参考重叠越少,LLM-score 越高表示目标保真更好且干扰泄漏更少;GPT-4.1 评分与人工偏好的一致率为音频目标 89%、视频目标 87%,人工之间一致率为 93% 与 90%。
启示与展望
该结果面向需要按指令指定模态作答的音视频大模型推理场景,适用于 CMM 与 AVHBench 所覆盖的源混淆接地幻觉评测,以及音频-视频不匹配输入下的模态特定描述。方法为免训练推理时引导,不需要重新训练模型,因此可直接叠加在已有音视频大模型上;论文在 VideoLLaMA2-AV-7B、Qwen2.5-Omni-7B 与 Qwen3-Omni-30B-A3B 上给出模型特定的引导深度,说明落地时需要按模型选择干预层。对希望提升多模态系统可靠性的工程实践者,这提供了一条保留完整音视频上下文、只在问题状态处做修正的路径。
所需模态识别依赖模型自身对纯文本问题的判断,论文报告 Qwen2.5-Omni-7B 在该诊断上达到 99.85% 的正确率,但对预测为 ambiguous 的情况采用随机选择模态,这一处理在更复杂问题上的影响仍是开放问题。引导深度按模型分别设定,论文观察到最佳深度与正负问题表征余弦相似度最低点相吻合,这一关联是否在更多模型与任务上稳定,尚待进一步验证。机制分析聚焦于路径层面的跨模态信息流,论文也指出更细粒度的单个注意力头角色分析尚未展开。此外,模态特定描述评测使用 400 个音频替换样本与 GPT-4.1 评分,虽有人工验证支持,但样本与评分口径的扩展空间仍值得关注。
