跳到主要内容
返回时间线
arXiv来源发表:

TeleAntiFraud 2.0:可刷新、基于画像、以音频为载体的电信诈骗检测基准

核心概要

该工作提出 TeleAntiFraud 2.0,一个以月度冻结快照形式组织的可刷新中文电话音频基准,通过混合树反诈生成流水线把网络诈骗案情摘要转化为共享情境、仅在带标签行为处分叉的诈骗与近域合法姊妹对话,并渲染为角色匹配语音;每个冻结集含 900 通中文电话(600 诈骗、300 近域非诈骗),受控文本实验显示三类分类器在无关或普通负例上达到完美 Macro-F1,而在近域姊妹负例上降至 0.65–0.68,全量音频与 ASR+LLM 评测进一步揭示类别先验捷径、预测坍缩与快照敏感性。

Source-provided article image: TeleAntiFraud 2.0: A Refreshable, Profile-Grounded, and Audio-Based Benchmark for Telecom Fraud Detection
Figure 1 ·

Figure 1: Mixed-tree construction and snapshot-level diagnostics, including tree-distance structure, transfer difficulty, prediction collapse, and snapshot variation.

arXiv

深度剖析

提出可版本化、月度冻结的音频基准,使新出现的诈骗模式可被纳入后续发布,而每个已发布快照保持不可变,并保留音频、标签与理由、生成元数据、评测提示、模型响应与溯源记录。 相较固定测试集(如 FDB 的共享划分、Fraud-R1 的固定交互集、TeleAntiFraud-28k 的固定音频文本集),该设计在吸收新案情的同时不覆盖既有评测集,从而支持可复现、可审计的纵向比较。 论文以表 1 对比说明“Refresh”列为 Monthly、“Frozen eval.”列为 Monthly snaps.,并说明当前两个快照支持快照敏感性分析,更长期的时间性结论需要更多发布。

开发混合树反诈生成流水线,将案情摘要经场景画像、混合树扩展、协作式对话实现与语音渲染四阶段转为可追溯通话音频,诈骗与合法姊妹路径共享参与者、情境、开场轮次与早期风险语言,仅在带标签行为出现后分叉。 与从同一画像独立生成诈骗与非诈骗通话相比,姊妹路径设计避免开场语境或会话框架出现与标签相关的差异,使标签取决于完整交互轨迹而非话题级线索。 论文给出混合树的形式化定义(节点集、边集、共享根、节点属性映射、路径状态映射与状态转移函数),并说明状态取值为模糊、诈骗、非诈骗三类,在带动作标签的边被遍历时更新。

受控文本与全量音频评测显示,无关或普通电信负例使任务近乎完全可分,而近域姊妹负例将 Macro-F1 降至 0.65–0.68;全量音频与 ASR+LLM 评测进一步暴露假阳性偏置、类别先验捷径、预测坍缩与跨月度快照的显著波动。 这些结果说明仅报告诈骗类 F1 不足以评估电信诈骗模型,需要联合报告类别均衡指标、类别条件召回、预测分布与坍缩行为。 论文报告三类分类器在受控文本实验中的表现,并在全量音频与 ASR+LLM 评测中观察到上述诊断行为;具体模型清单与逐项数值需查阅原文表格。

启示与展望

该基准面向中文电话音频场景,每个冻结集为 900 通电话(600 诈骗、300 近域非诈骗),适用于在共享情境下区分诈骗与近域合法通话的评测,以及跨月度快照的敏感性分析;其流水线设计允许把新收集的案情摘要纳入后续月度快照,因此适合需要持续跟踪新诈骗模式、同时保留既有评测记录与溯源信息的团队与评测方。

论文指出当前仅有两个快照,因此更长期的时间性结论需要更多发布;此外,全量音频与 ASR+LLM 评测中观察到的假阳性偏置、类别先验捷径与预测坍缩的具体幅度、涉及哪些模型族,以及 10 位专家审计与试点加审计的具体流程与一致性结果,需要结合原文表格与附录进一步核对。

来源