EASE 在生成阶段用熵自适应扰动 logits 与温度,把 Qwen3-8B 上五个检测器的平均 TPR@1%FPR 从 0.655 降到 0.339
核心概要
该工作观察到扰动下一 token 的 logits 或调整采样温度会降低 AI 生成文本检测器的性能,据此提出免训练、与检测器无关的 EASE 框架:它从源 LLM 的下一 token 分布计算预测熵,用该熵同时自适应地调节 logit 扰动强度与采样温度,在三个源 LLM 与多个检测器上一致降低检测性能,且推理开销与文本质量损失很小。
Figure 1: Effects of decoding changes on AIGT detection and text quality. AUROC and perplexity under (a,b) top- k k logit perturbation with strength s s at τ = 1 \tau=1 and (c,d) varying sampling temperature without logit perturbation. AUROC curves show means over all eight detectors and within two groups: statistical (Likelihood [ 10 ] , Entropy and LogRank [ 4 ] , and LRR [ 25 ] ) and supervised (RoBERTa-Base/Large [ 14 ] , MAGE [ 11 ] , and RADAR [ 7 ] ). Dash-dotted lines mark vanilla baselines.
arXiv深度剖析
论文报告了一个机制性观察:对下一 token 的 logits 加扰动或提高采样温度,都会降低检测器 AUROC,同时抬高生成困惑度,说明检测器对解码期分布变化敏感。 此前 evasion 研究多集中在文本级改写或需要检测器反馈、辅助模型、微调的生成过程改造;这里把“解码分布本身的变化”单独作为可测量信号提出。 基于第 4.1 节设置、不同随机种子的“小规模观察研究”,对 top-k logits 加高斯噪声并扫描扰动强度,以及在不加扰动时扫描温度,结果以 AUROC 与困惑度曲线呈现。
EASE 用预测熵驱动两个操作:低熵(分布集中)时施加更大 logit 扰动与更高采样温度以鼓励选择替代 token,分布趋于均匀时两项调整都减弱;logit 偏移由正弦的 token 相关调制决定符号与相对幅度。 把固定强度的扰动与固定温度替换为随当前候选分布浓度逐 token 变化的控制,且不需要检测器反馈、额外参数学习或模型微调。 方法在式 (2)–(5) 中给出;消融(表 4)显示去掉熵自适应后 AUROC 0.902、TPR@1%FPR 0.361,去掉温度自适应后为 0.927 / 0.487,完整 EASE 为 0.879 / 0.339,困惑度分别为 7.576、5.202、7.752。
在 Qwen3-8B 上,EASE-Plugin 相对无攻击基线把五个检测器的平均 AUROC 从 0.952 降到 0.879、平均 TPR@1%FPR 从 0.655 降到 0.339,并在两个 RoBERTa 检测器上取得最低值;其困惑度 7.752 低于所比较的改写类方法(9.867–15.196)。 与简单改写、递归改写、AdvPara 等改写类基线相比,EASE 在初始生成阶段即可生效,无需生成后再改写。 表 1 在 Qwen3-8B 上给出 PPL 与五个检测器的 AUROC / TPR@1%FPR;例如 RoBERTa-Large 上 TPR@1%FPR 由 0.535 降至 0.250,而所评估的改写基线在 0.583–0.615 之间。
跨模型与跨检测器评估中,EASE 在全部检测器–模型组合上降低 AUROC 并降低或维持 TPR@1%FPR;八个检测器的平均 TPR@1%FPR 在 Qwen3-8B 上由 0.425 降至 0.203,Llama3-8B 上由 0.446 降至 0.146,Ministral-3-8B 上由 0.141 降至 0.046。 把 evasion 效果从单一模型–检测器组合扩展到三个源 LLM 与多个检测器,并同时报告 BLEU/ROUGE 与困惑度以量化文本质量变化。 表 2 覆盖八个检测器与三个源 LLM;表 3 显示 BLEU-1 与 ROUGE-1 相对稳定,BLEU-2 与 ROUGE-2 小幅绝对下降,而困惑度上升(如 Qwen3-8B 由 4.243 升至 7.752)。
启示与展望
该框架面向控制源 LLM 解码过程的部署方:可在不查询检测器、不微调模型的前提下修改下一 token logits 与采样温度,适用于初始生成(EASE-Plugin)或生成后改写(EASE-Rewrite)两种流程。实验以 WikiText-103 的 2,000 条人类书写序列为提示,用前 30 个 token 生成至多 200 个 token 的续写,源模型为 Qwen3-8B、Llama3-8B-Instruct 与 Ministral-3-8B-Instruct。对检测方而言,这提示评测应覆盖不同解码设置,并关注解码引起的文本统计变化。
效果在不同检测器间并不均匀:Likelihood 与 Binoculars 在低假阳性率下下降明显,而 LRR 仍保留较强区分能力;部分检测器在无攻击时已接近或低于随机水平,这些设置下 AUROC 的进一步下降需在固定分数方向下解读。EASE-Rewrite 与 EASE-Plugin 的相对优势随检测器与指标变化,改写带来的 AUROC 优势并未稳定转化为低假阳性率下的更强 evasion。文本质量方面,BLEU-1 与 ROUGE-1 相对稳定,但困惑度上升,说明质量代价与攻击强度之间存在权衡。此外,观察研究为小规模、不同随机种子的设置,其结论向更大规模与更多领域的推广仍是开放问题。
