用聊天结构挑位置,只解释5%的token就能保住几乎全部威胁识别成功率
核心概要
该研究在4个模型、4个审计数据集上生成约470万条自然语言自编码器(NLA)解释,比较13种单次前向传播即可算出的位置打分信号与仅依赖聊天结构的排序器,发现聊天结构在14个模型-数据集组合中的12个里AUROC高于最佳单一信号,且在4个数据集中的3个上只解释5%的位置就能保留接近全量解释的审计成功率,并发现预训练verbalizer无需额外训练即可读出微调后模型刻意隐藏的词。
深度剖析
研究首次系统性地回答“NLA解释预算该花在哪些token位置”,把位置打分信号与逐位置解释是否切题(on-task)直接挂钩,构建了覆盖提示注入与隐瞒两类威胁的桥接实验。 此前工作按惯例选位置:只读答案前最后一个位置,或每条转录均匀取8个位置,并报告通用位置的解释只描述局部文本格式;本文把位置选择变成可测量的排序问题。 在4个模型(Qwen2.5-7B、Gemma-3-12B、Gemma-3-27B、Llama-3.3-70B)与4个数据集(OpenPromptInjection、Tensor Trust、Liars' Bench、taboo organisms)共14个单元上,对每个位置生成解释,共约470万条,由DeepSeek-V4-Flash在温度0下逐条判定是否切题。
来自激活向量的信号在单信号中最强,但仅用聊天结构训练的排序器在多数组合中超过最佳单信号,且不需要前向传播。 激活信号在14个单元中的多数里是最强单信号(resid_jump_nla在5个单元最强、dominant_mass在3个单元最强),但结构基线在14个单元中的12个里池化AUROC更高,在案例宏平均AUROC上也在多数单元更高。 结构基线只用segment、chat role、边界序号与归一化位置做逻辑回归,在留出转录上评估;论文同时报告随机分数与打乱标签两个对照,并说明信号方向需按数据集与模型分别拟合,方向用错时比随机选位置更差。
在固定解释预算下,解释5%的位置在4个数据集中的3个上保留了接近全量解释的审计成功率,但收益随审计任务变化。 论文把“审计成功”定义为转录中至少有一条解释切题,并给出预算为1个位置、8个位置、1%与10%时的精度,指出池化AUROC会掩盖“预算为1”时首位落在尖峰token上的问题,而双信号组合能把首位移开尖峰。 预算设为转录长度的5%时,结构排序器在OpenPromptInjection、taboo organisms、Tensor Trust上分别达到相应成功率,随机选择给出更低数值;要求3条切题解释的严格标准会降低这些数字;Liars' Bench因证据分散在整个对话中需要更多检查。
预训练verbalizer无需额外训练即可读出模型经微调学会隐瞒的词,且同一段文本在不同organism上得到不同答案,说明这不是文本反转。 这回应了“读激活的自然语言方法可能只是复述输入文本”的常见质疑:四个索要秘密词的提示中不含moon、ship、snow,同一基础模型的三个organism共享相同的聊天模板与用户消息。 12个organism(4个基础模型各微调隐瞒moon、ship或snow)中,解释在14%到27%的位置说出秘密词;在共享提示位置上,本organism的词被说出12%到25%,而另一个organism的词最多2.8%;判为切题与说出该词几乎同一事件(含词的解释98%被判切题,切题解释中88%到93%含该词)。
启示与展望
该结果面向需要为NLA解释分配有限算力的审计者:在提示注入与隐瞒两类任务上,可以先用聊天结构(segment、chat role、位置)排序位置,把预算集中在边界与靠后的输入位置,并在需要时用双信号组合把首位移开尖峰token。由于输入与边界token的隐状态在模型生成回复之前就可用,审计者可以在被审计模型输出行为之前完成检查与干预。论文也指出,切题率可以从少量解释样本中先估计,再据此决定是否值得做前向传播。
标签由单一评估模型(DeepSeek-V4-Flash)判定,作者提出用第二个模型与人工复核检验标签可靠性,这一点尚未完成。每个模型只评估了一个verbalizer层,转录也相对较短,跨层与更长agent转录的泛化仍待检验。跨模型迁移(留出一个模型做选择)的收益更小且不一致,taboo organisms上并不稳定优于迁移的单信号。Liars' Bench上两个模型看到的是不同转录,因此模型间位置差异无法与情境差异分离。此外,本证据包中的表格数值在正文里多处为空缺,若需精确的AUROC与精度数字,应查阅原文表格。
