arXiv 2026年10月5日作者在 Qwen2.5-VL-7B-Instruct 上用两阶段 PGD 攻击 200 张留出 COCO 图像,发现定向扰动可把固定目标描述的教师强制训练损失压到接近零,但自由生成仍输出原本正确的描述,并将这一“训练/推理鸿沟”定位到单个自回归步(目标 token 排名恒为 152,064 词表中的第 3,488 位、零方差),进一步追踪 28 层解码器显示视觉编码器对所有图像造成相近程度的表示破坏,而语言解码器对易感图像放大、对抵抗图像主动抑制该信号(p<0.001,rank-biserial r=0.579)。作者在 Qwen2.5-VL-7B-Instruct 上用两阶段 PGD 攻击 200 张留出 COCO 图像,发现定向扰动可把固定目标描述的教师强制训练损失压到接近零,但自由生成仍输出原本正确的描述,并将这一“训练/推理鸿沟”定位到单个自回归步(目标 token 排名恒为 152,064 词表中的第 3,488 位、零方差),进一步追踪 28 层解码器显示视觉编码器对所有图像造成相近程度的表示破坏,而语言解码器对易感图像放大、对抵抗图像主动抑制该信号(p<0.001,rank-biserial r=0.579)。Qwen2.5-VL-7B 在 200 张 COCO 图像上出现“训练/推理鸿沟”:目标 token 排名在每一步固定为 3,488,语言解码器而非视觉编码器决定是否被攻破作者在 Qwen2.5-VL-7B-Instruct 上用两阶段 PGD 攻击 200 张留出 COCO 图像,发现定向扰动可把固定目标描述的教师强制训练损失压到接近零,但自由生成仍输出原本正确的描述,并将这一“训练/推理鸿沟”定位到单个自回归步(目标 token 排名恒为 152,064 词表中的第 3,488 位、零方差),进一步追踪 28 层解码器显示视觉编码器对所有图像造成相近程度的表示破坏,而语言解码器对易感图像放大、对抵抗图像主动抑制该信号(p<0.001,rank-biserial r=0.579)。作者在 Qwen2.5-VL-7B-Instruct 上用两阶段 PGD 攻击 200 张留出 COCO 图像,发现定向扰动可把固定目标描述的教师强制训练损失压到接近零,但自由生成仍输出原本正确的描述,并将这一“训练/推理鸿沟”定位到单个自回归步(目标 token 排名恒为 152,064 词表中的第 3,488 位、零方差),进一步追踪 28 层解码器显示视觉编码器对所有图像造成相近程度的表示破坏,而语言解码器对易感图像放大、对抵抗图像主动抑制该信号(p<0.001,rank-biserial r=0.579)。