可刷新、近域对照的电信诈骗音频评测基准:TeleAntiFraud 2.0
核心概要
该工作提出 TeleAntiFraud 2.0——一个以月度冻结快照组织的可刷新中文电信诈骗音频基准,用混合树生成让诈骗与合法近域通话共享情境、仅在决定标签的行为处分叉,并报告在无关或普通负例下三个文本分类器达到完美 Macro-F1,而换成近域同源负例后降至 0.65–0.68,同时全量音频与 ASR+LLM 评测暴露出类别先验捷径、预测坍缩与快照敏感性。
深度剖析
提出以不可变月度快照组织的可刷新音频基准,每个冻结集含 900 通中文通话(600 诈骗、300 近域非诈骗),并冻结音频、标签、提示、清单与溯源记录。 相较固定测试集无法纳入新出现的诈骗手法、而持续替换旧样本又难以复现比较,该设计让新收集的诈骗案例摘要经同一流水线进入后续版本,同时已发布快照保持不可变。 论文给出两个独立构建的快照(June/V1 与 July/V2),各 900 通、组成固定为 2:1,并说明快照共享生成、合成与评测契约但独立采样场景、对话树与音色分配。
提出 Mixed-Tree Anti-Fraud Generation Pipeline,把在线诈骗案例摘要转为结构化场景画像,扩展为混合对话树,使诈骗与合法兄弟路径共享参与者、情境、开场轮次与早期风险语言,仅在出现带标签证据的行为后分叉。 以往非诈骗负例常来自无关主题或不同数据源,模型可能依赖词汇或来源捷径;共享上下文的兄弟路径把标签绑定到完整交互轨迹而非话题线索。 受控文本实验中,Bigram、LR、SVM、RoBERTa 在无关随机与普通域内负例上 Macro-F1 为 1.000,在近域兄弟负例上降至 0.650–0.680;词重叠度随负例难度上升(0.005、0.161、0.274)。
全量音频与 ASR+LLM 评测显示预测坍缩、类别先验捷径与快照敏感性,而非单一分数可概括的表现差异。 论文主张仅报告诈骗类 F1 不足,需联合报告 Macro-F1、Balanced Accuracy、两类召回与预测类别分布,并保留原始预测。 在提示语言平均前,V1 的 27 个配置中有 11 个、V2 去重后的 27 个配置中有 15 个呈现全判为 FRAUD 的特征:诈骗召回接近 1.0、准确率接近 2:1 先验、诈骗 F1 接近 0.80;类别先验重采样显示全 FRAUD 基线的诈骗 F1 随诈骗占比从 0.500 升至 0.800,而 Balanced Accuracy 保持 0.500、非诈骗召回为零。
构建分析独立审计了树结构、标签可追溯性与语音渲染控制。 除检测分数外,论文对生成产物本身做审计,包括路径级标签理由、专家标签复核与音色池覆盖。 813 段对话的 BGE-small-zh 嵌入显示树内平均距离 0.0188、跨树 0.3351(比值 17.8);留一树 F1 从域内 0.883 降至 0.605;十位专家各审 100 项、共 1000 条判断,与修正金标一致率平均 0.792(范围 0.700–0.880),494 判为 FRAUD、506 判为 NONFRAUD,744 条被标为证据充分;80 段对话的单标注者试点在对话真实感、策略连贯性、受害者反应合理性与音频自然度上均值为 4.60、4.41、4.35、4.13(1–5 分)。
启示与展望
该基准面向防御性研究,用于在可复现、可审计的条件下追踪音频电信诈骗检测进展;其适用场景是中文通话、以月度冻结快照为单位、诈骗与非诈骗按 2:1 组成,并保留近域合法通话以考察边界识别。流水线以固定模式接收新收集的案例摘要,因此后续快照可在不改动既有产物与结果的前提下纳入新出现的诈骗手法;清单契约也支持按 1:1 重新评测。论文明确说明使用合成对话与合成语音,因为真实诈骗通话常含隐私、安全敏感与潜在有害内容,因此该基准被定位为受控诊断工具。
论文指出当前只有两个快照,因此支持快照敏感性分析,而更长期的时间趋势结论需要更多版本发布。跨基准比较中,由于来源、音频流水线与标签定义不同,该分析衡量的是同一分类器下的相对线性可分性,而非直接基准排名,因此不能把差距全部归因于单一构造因素。语音渲染方面,35 个授权参考音色包含 29 个男声与 6 个女声,论文将人口统计代表性列为局限;去除情感标记使 15 对对话的总体 F1 从 0.920 变为 0.960、单模型最大差异 4.6 个百分点,论文因此把情感视为受控渲染变量而不作因果断言。标签审计中一致率较低的包指向困难或模糊案例。此外,干净 CER/WER 估计需要整段或分段转写,论文说明其不在当前评分契约内;若读者需要更细的语音识别误差刻画,这仍是一个待补的开放问题。
