跳到主要内容
返回时间线
arXiv来源发表:

PADBen:面向改写攻击的AI文本检测器综合基准

核心概要

该工作通过双表征空间分析提出“中间洗白区”机制,构建包含五类文本分类体系与五项递进检测任务的PADBen基准,并评测11个检测器,发现检测结果存在关键不对称性:改写攻击并非普遍奏效,抄袭规避(改写LLM生成文本)仍可被检测(RADAR句对AUC 0.909),而作者身份混淆(改写人类文本)使检测性能跌至接近随机(AUC 0.526–0.748)。

Source-provided article image: PADBen: A Comprehensive Benchmark for Evaluating AI Text Detectors Against Paraphrase Attacks
Figure 1

Figure 1: Overall pipeline for benchmark curation. Preprocessing details in Appendix A, data generation in Appendix C.3.

· 第 4 页

深度剖析

提出“中间洗白区”机制:迭代改写造成语义位移但保留生成模式,使文本进入一个既偏离原始来源又保留生成特征的中间区域。 此前基准多将改写视为单步扰动,未系统刻画迭代改写如何在表征空间中逐步演化;该工作通过BGE-M3嵌入与Qwen3-4B隐藏状态的双表征分析,追踪10次迭代的质心轨迹,揭示该区域具有普遍性(可从人类与LLM两种起点到达)与稳定性(迭代可可靠抵达)。 基于BGE-M3嵌入与Qwen3-4B隐藏状态的定量距离分析(如人类文本与迭代改写人类文本的余弦距离从0.085升至0.134,而LLM生成文本与迭代改写人类文本的距离稳定在约0.698),并辅以PCA轨迹可视化;实验2每类采样100条文本,作者在局限性中说明样本量与长度控制可进一步扩展。

构建五类文本分类体系与五项递进检测任务,覆盖从原始内容到深度洗白文本的完整轨迹,并在单句分类与句对识别两种格式下评估检测器鲁棒性。 既有基准如RAID仅采用单步Dipper改写,PARAPHRASUS聚焦改写识别而非对抗鲁棒性;PADBen首次将改写攻击区分为作者身份混淆与抄袭规避两类场景,并设置递进任务(任务1至任务5)系统评估。 数据集基于MRPC、HLPC、PAWS三个公开语料构建,经余弦相似度0.85阈值去重后得到16233条人类原创文本;生成流程使用Gemini-2.5-Pro、DIPPER、LLaMA-3-8B等多模型,并通过Jaccard相似度、困惑度与self-BLEU进行质量评估(如人类改写Jaccard为0.798,Type 5-3rd的self-BLEU为0.170)。

对11个检测器(4个零样本、7个基于模型)的评测揭示关键不对称性:抄袭规避仍可检测,而作者身份混淆导致检测崩溃。 此前工作未在同一基准下同时评估两类改写攻击场景;该工作通过任务3与任务5的对比,实证确认两类攻击虽共享中间洗白区,但产生不同的检测信号。 任务3中RADAR句对AUC为0.748、单句降至0.50–0.63,所有检测器接近随机;任务5中RADAR句对AUC达0.909、穷举单句0.803,Kimi-K2-Instruct单句AUC为0.573;任务4所有检测器AUC在0.487–0.529之间,呈普遍失败。

启示与展望

该基准面向AI文本检测器鲁棒性评估的研究者与工程实践者,适用于英文句子级、以改写攻击为核心威胁的场景;其五类文本体系与五项任务可用于比较不同检测器在作者身份混淆与抄袭规避两类攻击下的表现,并为后续检测架构设计提供评估框架。

机制实验的样本量为每类100条,文本长度在迭代改写中未严格保持一致,作者在局限性中说明这些方面可进一步扩展;分类体系目前覆盖Type 5的1次与3次迭代,更深迭代(如5–10次)与人类文本的中间迭代变体尚未纳入;句对任务均包含至少一侧为改写文本,未包含人类原创与LLM原创的直接配对;检测器均以默认配置评测,未在PADBen上微调。这些是后续可探索的方向,而非对当前工作的否定。

来源