arXiv 2026年10月5日该工作以严格的留一数据集(LODO)评估,在13个安全基准(越狱、注入与良性对话)和三个开放权重模型家族(Llama-3.1-8B、Qwen3.5-9B、Gemma-4-12B)上比较用户回合后不同后缀对激活探针的影响,发现分类式后缀在单点探针上稳定提升分布外检测(最高约4个AUC点),且增益来自分类格式而非具体判据,内容无关标签的后缀可与真实恶意/良性判据相当,该收益也能延续到生产中的多点池化探针(注意力、multi-max、MLP),但最佳后缀随读出方式而变。该工作以严格的留一数据集(LODO)评估,在13个安全基准(越狱、注入与良性对话)和三个开放权重模型家族(Llama-3.1-8B、Qwen3.5-9B、Gemma-4-12B)上比较用户回合后不同后缀对激活探针的影响,发现分类式后缀在单点探针上稳定提升分布外检测(最高约4个AUC点),且增益来自分类格式而非具体判据,内容无关标签的后缀可与真实恶意/良性判据相当,该收益也能延续到生产中的多点池化探针(注意力、multi-max、MLP),但最佳后缀随读出方式而变。在用户回合后追加分类指令,使激活探针的分布外恶意输入检测最高提升约4个AUC点该工作以严格的留一数据集(LODO)评估,在13个安全基准(越狱、注入与良性对话)和三个开放权重模型家族(Llama-3.1-8B、Qwen3.5-9B、Gemma-4-12B)上比较用户回合后不同后缀对激活探针的影响,发现分类式后缀在单点探针上稳定提升分布外检测(最高约4个AUC点),且增益来自分类格式而非具体判据,内容无关标签的后缀可与真实恶意/良性判据相当,该收益也能延续到生产中的多点池化探针(注意力、multi-max、MLP),但最佳后缀随读出方式而变。该工作以严格的留一数据集(LODO)评估,在13个安全基准(越狱、注入与良性对话)和三个开放权重模型家族(Llama-3.1-8B、Qwen3.5-9B、Gemma-4-12B)上比较用户回合后不同后缀对激活探针的影响,发现分类式后缀在单点探针上稳定提升分布外检测(最高约4个AUC点),且增益来自分类格式而非具体判据,内容无关标签的后缀可与真实恶意/良性判据相当,该收益也能延续到生产中的多点池化探针(注意力、multi-max、MLP),但最佳后缀随读出方式而变。