跳到主要内容
返回时间线
arXiv来源发表:

ArGuard 共享任务:58 支队伍注册、35 支参赛,阿拉伯语表情包与 LLM 提示词有害内容检测最佳系统 macro-F1 达 0.823/0.419/0.984/0.790

核心概要

ArGuard 是一个针对阿拉伯语有害内容检测的共享任务,包含两条赛道:Track A 面向阿拉伯语表情包的多模态仇恨检测,Track B 面向阿拉伯语 LLM 安全评估的有害提示词检测;共有 58 支队伍注册、35 支参加最终评测、27 支提交系统描述论文,参赛队伍探索了 AraBERT、Jais、Qwen3-VL 等模型,最佳系统在 A1、A2、B1、B2 上分别取得 macro-F1 0.823、0.419、0.984、0.790,其中 A2 的细粒度表情包分类因标签稀疏与训练-测试分布偏移而最具挑战。

Source-provided article image: ArGuard Shared Task: Harmful Content Detection in Arabic Memes and LLM Prompts
Figure 1 ·

Figure 1: Overview of the ArGuard tracks and subtasks. Top: Track A covers binary (A1) and fine-grained (A2) Arabic hateful meme detection. Bottom: Track B covers binary safety (B1) and fine-grained harm-category (B2) classification of LLM prompts.

arXiv

深度剖析

该工作提出并组织了 ArGuard 共享任务,把阿拉伯语有害内容检测拆分为两条赛道:Track A 的多模态表情包仇恨检测与 Track B 的阿拉伯语 LLM 有害提示词检测。 相对于单一模态或单一任务的既有评测设置,这里同时覆盖了图像-文本表情包与 LLM 提示词两类对象,并明确区分多模态仇恨检测与 LLM 安全评估两种目标。 依据摘要所述的任务设计:两条赛道、四个子设置(A1、A2、B1、B2),并有 58 支注册队伍、35 支最终评测队伍、27 篇系统描述论文的参与规模。

参赛系统在四个子设置上的最佳 macro-F1 分别为 A1 0.823、A2 0.419、B1 0.984、B2 0.790,显示不同子任务难度差异明显。 这组数字给出了阿拉伯语有害内容检测各子设置当前可达到的性能参照,其中 B1 接近满分而 A2 明显偏低。 来自摘要报告的最佳系统 macro-F1 数值,属于共享任务最终评测结果。

A2 的细粒度表情包分类被认定为最具挑战的设置,摘要将其部分归因于标签稀疏与训练-测试分布偏移。 这把难度来源从模型能力问题转向数据层面的稀疏标注与分布差异,为后续数据构建与评测设计提供了具体指向。 摘要明确表述 A2 是最具挑战的设置,并给出“partly due to sparse labels and train-test distribution shifts”的原因说明;未提供进一步的定量分解。

参赛队伍探索了 AraBERT、Jais、Qwen3-VL 等模型,覆盖阿拉伯语预训练语言模型与多模态模型两类技术路线。 这反映出该任务上既有面向阿拉伯语文本的模型方案,也有面向多模态表情包的模型方案,形成可比较的方法图景。 摘要列举了参赛队伍探索的模型名称,未给出各模型的具体配置或逐队成绩。

启示与展望

该工作面向阿拉伯语有害内容检测这一具体场景,适用于两类使用者:一是构建阿拉伯语内容审核或 LLM 安全过滤系统的团队,可把 A1、A2、B1、B2 的最佳 macro-F1 作为性能参照;二是研究多模态仇恨检测与提示词安全评测的研究者,可据此了解 AraBERT、Jais、Qwen3-VL 等模型在该任务上的探索方向。结果适用于共享任务设定的评测条件,摘要未说明其是否可直接迁移到其他语言、其他平台或真实生产流量。

摘要未给出各子设置的数据规模、标注流程、标签体系细节,也未说明 A2 中标签稀疏与分布偏移的具体程度,因此难以判断 0.419 这一结果在多大程度上受数据因素影响。摘要亦未列出各参赛系统的逐队成绩与所用模型的详细配置,无法比较不同技术路线的相对贡献。此外,摘要未说明数据与系统描述论文是否公开,读者若计划复现或复用需进一步查阅原文。

来源