Qwen2.5-VL-7B 在 200 张 COCO 图像上出现“训练/推理鸿沟”:目标 token 排名在每一步固定为 3,488,语言解码器而非视觉编码器决定是否被攻破
相关研究与后续进展核心概要
作者在 Qwen2.5-VL-7B-Instruct 上用两阶段 PGD 攻击 200 张留出 COCO 图像,发现定向扰动可把固定目标描述的教师强制训练损失压到接近零,但自由生成仍输出原本正确的描述,并将这一“训练/推理鸿沟”定位到单个自回归步(目标 token 排名恒为 152,064 词表中的第 3,488 位、零方差),进一步追踪 28 层解码器显示视觉编码器对所有图像造成相近程度的表示破坏,而语言解码器对易感图像放大、对抵抗图像主动抑制该信号(p<0.001,rank-biserial r=0.579)。
Figure 1 : Per-token probability analysis across 200 images and all three outcome groups. The rank of the target token _coconut , conditioned on the correct preceding token A already appearing in context, is a flat line at exactly 3,488 with zero variance, for every image, every group, clean and adversarial alike.
arXiv深度剖析
论文提出并命名了“训练/推理鸿沟”:定向对抗扰动能让 VLM 对固定目标描述的教师强制训练损失接近零,但同一模型自由生成时仍给出原始正确描述,目标毫无痕迹。 此前对抗鲁棒性讨论多聚焦于攻击是否成功改变输出,这里把“损失被压低”与“生成未被改变”明确区分为两种可分离现象,并给出机制层面的解释目标。 在 Qwen2.5-VL-7B-Instruct 上以受控两阶段 PGD 攻击 200 张留出 COCO 图像进行验证,属于单一模型、单一数据集规模的机制研究。
图像级像素统计对“哪些图像会被攻破”几乎没有预测力,包括重新正确实现的、来自 CNN 鲁棒性文献的纹理型可攻击性度量。 把 CNN 时代常用的可攻击性预测指标迁移到 VLM 场景并检验其失效,说明易感性不能由输入图像的表层统计解释。 最佳预测因子 r=-0.050、p=0.484,岭回归 R^2=0.069,均表明预测力接近随机水平。
鸿沟被定位到单个自回归步:在已生成正确首 token 的条件下,目标 token 的排名对每张图像、每种条件都恰好是 152,064 词表中的第 3,488 位,且零方差。 用 logit lens 把弥散的现象收敛到一个确定性的、可复现的步骤,为后续机制分析与防御定位提供了明确坐标。 排名数值在所有图像与条件下完全一致、方差为零,是强规律性观察,但基于单一模型与固定攻击设置。
追踪全部 28 层 LLM 解码器显示,视觉编码器对所有图像的表示破坏程度相近,而语言模型解码器进行差异化仲裁:对易感图像放大被破坏的信号,对抵抗图像则主动抑制到低于其干净图像基线。 把鲁棒性归因从视觉编码器转向语言解码器的先验,指出防御与忠实度评估应针对解码器而非仅针对视觉前端。 组间差异 p<0.001、rank-biserial r=0.579;merger 隐状态上的线性探针以 AUC=0.858 区分两种结果,但作者自行标注该估计存在循环性隐忧。
启示与展望
该工作面向自回归视觉语言模型的对抗鲁棒性与忠实度评估,实验设定为 Qwen2.5-VL-7B-Instruct 与 200 张留出 COCO 图像上的受控两阶段 PGD 攻击,适用于需要理解“训练损失与生成行为为何脱钩”的研究者与防御设计者。其结论直接指向防御与评估应针对语言解码器先验而非仅视觉编码器,为后续在其他 VLM、其他攻击与更大图像规模上检验该机制提供了可复现的起点。
读者仍需关注:该机制刻画基于单一模型与 200 张 COCO 图像,是否在其他 VLM 架构、其他攻击方法与更大规模数据上保持同样的固定排名与解码器仲裁模式尚待检验;merger 隐状态线性探针 AUC=0.858 的循环性隐忧由作者自行标注,其判别能力的独立确认仍需后续工作;此外,目标 token 排名恒为第 3,488 位这一零方差现象背后的成因,以及它是否与具体词表、提示格式或攻击超参绑定,仍是开放问题。
