Tri-PvP 用 8000 条三模态冲突样本证明:全模态大模型普遍偏向图像,且视觉偏好感知证据、音频偏好命题证据
核心概要
研究者构建了 Tri-PvP——一个 8000 样本、覆盖动物、情绪、环境、音乐四个日常领域的三模态冲突基准,让图像与音频各自以感知形式(真实照片/录音)或命题形式(文字卡片图/TTS 语音)出现、文本始终为命题形式,在四个证据类型条件下评测五个全模态大模型,发现图像偏向在 20 个(模型×条件)组合中的 18 个里占主导,且存在系统性不对称:模型在视觉上更偏向感知证据、在音频上更偏向命题证据,这种偏向在早期隐藏层即可被线性解码,用对比解码只能部分缓解并带来残余文本偏向。
深度剖析
论文指出既有三模态偏向基准存在结构性混淆:同一模态内的感知证据(如狗的照片或叫声录音)与命题证据(如“这是一只狗”的陈述)被混在一起,而视觉几乎总是自然图像、音频混合真实录音与合成语音、文本天然是命题的,因此测到的“模态偏向”与“证据形式偏向”纠缠在一起,无法干净归因。 相对此前工作,论文把认识论中感知证据与命题证据的区分形式化为可实验操控的轴,并据此设计基准,使图像与音频各自可取感知或命题形式,从而把模态偏向与证据形式偏向分离开来。 该论断由基准设计本身支撑:四个证据类型条件(PercI-PercA、PercI-PropA、PropI-PercA、PropI-PropA)作为匹配的反事实构造,同一组标签三元组在四种条件下复用相同素材,且跨模态标签组合数量被平衡。
在五个全模态大模型上,图像偏向在绝大多数模型与条件下占主导,音频偏向始终是最弱的单模态偏向;把视觉或音频通道从感知换成命题只会削弱、不会逆转这种偏好。 论文给出了偏向的方向与量级:20 个(模型×证据类型)组合中 18 个以 BIAS_IMAGE 为主导,其幅度常超过 60%;BIAS_AUDIO 在 20 个组合中的 18 个里是三种单模态偏向中最小的,通常低于 10%。 证据来自对 Qwen2.5-Omni-7B、MiniCPM-o 4.5、Qwen3-Omni-30B-A3B-Thinking、Gemma 4 E4B、Gemini 3 Flash 五个模型的评测,自由回答由 LLM 裁判按八类互斥标签分类,作者对 800 条(10%)分层抽样人工核验,与裁判一致率 97.1%。
论文揭示证据形式偏向的系统性不对称:模型在视觉上更偏向感知证据,在音频上更偏向命题证据;例如 Qwen2.5 的 BIAS_IMAGE 在 PercI-PropA 下为 49.7%,在 PropI-PropA 下仅 12.7%,而 Gemma4 的音频偏向从 PercI-PercA 的 0.9% 升到 PercI-PropA 的 25.4%。 这一不对称是此前基准无法观测的,因为它需要独立操控每个通道的证据形式;论文将其与两种模态编码器的预训练目标差异联系起来——视觉编码器通常学习感知内容,音频编码器常由强调语音语言内容恢复的 ASR 式目标初始化。 证据为跨模型、跨条件的偏向分布统计,并附 95% 置信区间;作者同时说明该解释是假设性的,指向全模态模型需要更强的感知音频理解。
层级线性探针显示模态偏向信息在生成任何 token 之前就已可从中间隐藏状态线性解码,图像偏向可解码性最高、音频最低;对比解码作为推理期诊断干预能显著降低图像偏向并提升无偏向回答比例,但会引入残余文本偏向,且在 OmniBench 上总体准确率仅从 38.4% 变为 37.4%。 这把偏向从输出层现象推进到表征层现象,并说明表层干预不足以解决;对比解码在 PropI-PropA 下把图像偏向从 74.9% 降到 38.8%、把无偏向回答从 7.2% 提到 38.6%,但文本偏向在四个条件下均上升,幅度从 2.2% 到 13.5%。 探针实验在 Gemma4 与 Qwen2.5 上逐层训练逻辑回归并报告平衡准确率,Qwen2.5 的图像探针在两种 PercI 条件下峰值达 80%;对比解码实验限于 Gemma4 单一模型与固定的 α、自适应合理性阈值,OmniBench 评测使用 1142 道三模态选择题。
启示与展望
这项工作面向日常感知尺度,即人类通常依赖直接感知的场景,覆盖动物、情绪、环境、音乐四个领域,与当前全模态模型作为个人助理的部署语境一致;提问被刻意设计为偏向中性,以引出模型未被提示的模态偏好。它适用于需要评测或诊断全模态模型在图像、音频、文本三方冲突下信任倾向的研究者与开发者,也适用于希望复用其受控证据形式设计来构建新基准的后续工作。对比解码作为诊断性干预,适用于推理期、无需更新参数的场景。
论文自述的边界值得留意:基准只覆盖日常尺度,模型在复杂图表或科学数据等更广认知尺度下的冲突行为尚不清楚;提问刻意保持中性,若改为要求枚举全部来源、强制单一答案或提供来源可靠性线索,偏好如何变化是另一个问题。对比解码实验只在一个模型上、以固定的 α 与自适应合理性阈值完成,缺少系数敏感性分析与更广模型上的验证,且需要额外一次前向计算、成本更高。此外,无偏向回答的构成在不同模型间差异很大,从真正承认冲突到被动罗列模态内容不等,因此“命题条件下模型更少偏向单一输入流”这一说法需要按模型区分理解。本总结基于论文全文与其附录,未包含图 2、图 3、图 4、图 5、图 6 的图像内容本身。
