跳到主要内容
返回时间线
arXiv来源发表:

匹配评测显示:DPO 在安全控制与文本监控上整体领先,表征探针以更低边际算力保持竞争力

核心概要

该工作在同一套匹配设置下,把行为式安全方法(DPO 对齐、文本监控器)与表征工程(三种表征引导、四种表征探针)放在一起比较,发现 DPO 在安全控制上整体最强且随训练数据增加而改善、但在良性微调后安全性会下降,专用文本监控器检测准确率最高,而表征探针在复用原生激活时以低得多的边际算力保持竞争力,并且探针引导的干预能挽回 DPO 在良性微调后损失的大部分安全性且几乎不增加过度拒答。

AI-generated editorial illustration: When Do Model Internals Help? Exploring the Role of Representation Engineering in LLM Safety

深度剖析

在安全控制上,DPO 在匹配监督下提供最强的越狱鲁棒性,Flow 次之,CAA 与探针式引导接近基座模型;但 DPO 在良性微调后安全性下降最明显,AIM 攻击成功率从 0.027 升至 0.436。 以往表征引导多只与其他引导技术比较,行为对齐与表征引导很少在同一模型、同一数据、同一评测协议下并排比较,该工作用同一批 5,406 条 PKU-SafeRLHF 配对数据在 Qwen2.5-1.5B/14B 与 Llama-3.1-8B 上做了匹配对照。 宏平均 ASR 表覆盖三种模型、两种攻击(AIM 与拒绝抑制)以及良性微调前后;良性微调使用 20,000 条 Alpaca-Cleaned 样本,引导向量不重新提取。

表征引导的竞争力集中在低数据、高质量对比数据场景:Flow 在小规模过滤对比子集上可匹配或超过 DPO,而 CAA 与探针式引导几乎不随数据量增加而改善。 把数据量与数据质量分开考察,显示 DPO 在原始偏好数据与过滤对比数据上都随规模改善,而引导方法的收益更多来自监督质量而非数量。 数据缩放实验在 Qwen2.5-1.5B-Instruct 上覆盖 100 至 63,094 对样本,100 与 200 对设置取三个随机种子均值,报告的同设置 ASR 标准差均值为 0.0054。

在安全监控上,专用文本监控器整体检测最强(Qwen3Guard AUROC 0.996、AUPRC 0.995),最强表征探针(均值池化)达到 0.982 AUROC 与 0.978 AUPRC;流式检测中 Qwen3Guard 召回 0.948、中位首次报警位置 0.034,而滚动探针召回 0.913、序列级假阳性率最低为 0.017。 表征探针与文本监控器此前很少在共享安全设置下比较,该工作在同一批由 Qwen2.5-32B-Instruct 原生生成的轨迹上,同时报告全响应检测、流式早期检测与算力成本。 全响应检测使用 918 条轨迹(384 有害、534 安全),流式检测使用 384 条有害与 200 条安全轨迹,阈值在提示级划分的校准集上按 1% 与 5% 目标假阳性率选定后固定。

探针引导的干预能挽回 DPO 在良性微调后损失的大部分安全性:在 5% 校准阈值下,阻断与纠正性重生成把微调后 14B DPO 模型的平均 ASR 从 0.500 降到 0.042,过度拒答仅从 0.108 升到 0.124(阻断)与 0.120(重生成);文本监控器触发阻断同样有效。 以往较少检验监控信号能否反过来改善下游控制,该工作把监控与控制耦合,并比较阻断、纠正性重生成与自适应 Flow 引导三种策略。 主文结果在 Qwen2.5-14B-Instruct 上对 AIM 与拒绝抑制取平均,附录报告了其他模型规模、攻击、阈值与文本监控器基线;作者说明部分控制实验使用单一训练种子,且越狱评测使用非自适应攻击。

启示与展望

该结果面向需要在控制与监控之间做取舍的安全工程与部署场景:当高质量安全数据有限时,Flow 式表征引导是可考虑的选项;当生成模型的内部激活可被复用时,表征探针能以低边际算力提供监控;当已有对齐模型在良性微调后安全性下降时,探针或文本监控器触发的生成后阻断与纠正性重生成可用于补强。评测范围是 Qwen2.5-1.5B/14B/32B 与 Llama-3.1-8B 等公开模型、PKU-SafeRLHF 与 StrongREJECT、HarmBench、XSTest 等公开基准,以及 AIM 与拒绝抑制两类攻击。

作者指出两点范围限制:部分控制实验使用单一训练种子,结果不反映运行间波动;越狱评测使用非自适应攻击,未评估针对已部署防护定制提示的攻击者。监控方面,校准集仅含 51 条安全轨迹,可实现的假阳性率是离散的,测试集实现 FPR 可能偏离校准目标;检测位置是相对响应长度的归一化量,并不确立报警是否先于有害内容出现。附录的复现实验显示,表征探针在回放(而非原生复用激活)时优势收窄,且需要额外一次前向传播;隐藏推理访问实验使用回放激活,作者将其视为推理可及性价值的证据而非表征探针的普遍优势。此外,本证据包为全文文本,部分表格中的数值在文本中未完整呈现,因此个别具体数字无法在此逐项核对。

来源