可解码但被错误路由:稀疏特征揭示视觉语言模型在有害模因检测中的读出缺口
核心概要
该研究用稀疏自编码器、角色条件探针、因果干预与恢复实验,在 Gemma-3 与 Qwen3.5 上跨六个有害内容基准(并补充西班牙语与印地语-英语混合语评估)区分“模型未表征证据”与“已表征但未路由到输出”两种失败,发现稀疏读出在全部六个二分类任务上均优于原生预测(Qwen 平均 0.740 对 0.432,Gemma 从 0.532 升至 0.714),探针判别方向与输出路由方向可分离,仅校准的路由恢复平均缺口的 93.3%,探针蒸馏 LoRA 可改善原生预测但共享多任务适配带来负迁移,且信号超出英语、不能仅由所提供 OCR 解释、并依赖成对视觉证据。
Figure 1: Residual-SAE construction and readout pathways. A. A frozen base SAE reconstructs layer- ℓ \ell states, while a trainable SAE models the normalized reconstruction residual, yielding base and joint reconstructions. B. The resulting representation supports native scoring, residual-reconstruction hooks, sparse probing, calibrated output routing, and probe-distilled LoRA. Snowflakes and flames denote frozen and trainable components, respectively.
arXiv深度剖析
稀疏读出在 Gemma-3 与 Qwen3.5 的全部六个二分类任务上均超过原生预测,且最具信息量的 token 角色随任务变化,细粒度标签仍明显更难。 此前有害模因工作多优化最终检测器,未把表征失败与读出失败分开;该工作用同一冻结模型对比原生约束预测与稀疏探针,把“可解码性”作为独立可测的量。 锁定报告划分上的宏 F1 对比:Gemma 均值 0.532→0.714,Qwen 均值 0.432→0.740;Qwen 六个探针共用同一公开第 20 层 SAE,Gemma 在另一模型与稀疏表征机制下复现该模式。
在 Qwen 中,探针判别方向与输出路由方向可被干预分离:消融“沉默特征”对探针的影响是 24–63 倍于对原生 yes/no 边界的监测影响,而修补路由特征对原生边界的影响是 16–140 倍于对探针的影响。 以往探针研究常把可解码性等同于模型使用;该工作用独立选取的输出对齐特征与因果干预,把“判别性”与“被路由”拆成两类方向,并指出高探针重要性与高直接输出对齐的区域在六个任务中的五个为空。 基于 Qwen 公开 base SAE 的消融与供体-目标修补,沉默特征消融每任务 15 个合格样本、路由特征修补每任务 5 对供体-目标;作者明确说明这些比值依赖两个分数尺度,不是尺度不变的介导比例。
该分离可转化为恢复路径:仅用校准集的路由把 Qwen 平均宏 F1 从 0.4405 提升到 0.7204,接近探针上限 0.7404,即恢复平均缺口的 93.3%;探针蒸馏 LoRA 也能改善原生预测,但共享七任务适配器造成负迁移。 此前工作多止于诊断内部表征与输出不一致;该工作进一步测试两条恢复路径(输出端直接路由与把读出内化进模型参数),并对比专用与共享适配器。 路由在匹配的 Qwen 报告子集上改善全部六个二分类任务,四个任务选到最大测试系数 β=8;专用 FHM 适配器把测试可见宏 F1 从 0.6482 提到 0.7138,而共享适配器在同一开发集上 0.6548 低于专用的 0.7095,并把六分类 MMHS150K 从 0.3727 降到 0.1886。
Gemma-3-12B 在 FHM 上呈现模型特定的分布式 rank-32 图像-提示交互,达到 0.756 对原生 0.685;跨语言与混合语、OCR 消融与图像扰动控制表明该效应超出英语、不能仅由所提供 OCR 解释、并实质依赖成对视觉证据。 FHM 的良性混淆项使单角色或简单池化交互读出失效,该工作用低秩双线性项显式建模图像位置与提示/OCR 位置的交互,并用留一因子干预说明该交互是分布式的而非单一特征对。 校准选出的 rank-32 检查点在报告测试上 0.7560 对原生 0.6853,配对自助 95% 置信区间 [0.0461, 0.0954];32 个因子中 11 个有可测留一效应但任一单因子移除至多改变验证宏 F1 0.007;图像置换使探针宏 F1 下降 0.148–0.206、路由下降 0.160–0.292。
启示与展望
该工作面向使用冻结视觉语言模型做有害模因分类的研究与工程场景,其读出缺口定义限于所分析层、SAE 字典、特征与输出锚点,恢复路径在 Qwen 匹配报告子集与 Gemma-3-4B-IT 蒸馏设置下验证;多语言结论基于固定内部留出集,FHM 交互结论限于 Gemma-3-12B 第 31 层表征。它使后续工作可以在此基础上测试更大模型、更多层与字典、更广的多语言与细粒度数据,并探索位置匹配修补与路径级追踪。
读者仍会关注:探针与原生模型并非同条件比较,改进的宏 F1 是否对应可部署的审核可靠性;机制结论在所选层、字典、特征与输出锚点之外是否成立;部分干预仅使用 12–15 个合格样本,比值又依赖分数尺度;token 角色标识的是位置来源而非模态纯净状态,生成 token 探针是生成后读出;FHM 交互未迁移到所有模型;多语言结果依赖内部留出集,稀有细粒度类别仍难分辨。此外,本次加载为全文,但部分图表与附录细节以摘要形式呈现,若需核对具体样本计数与逐任务效应,仍需查阅原始附录。
