跳到主要内容
返回时间线
arXiv来源发表:

面向低资源语言的自动化NER标注纠错可扩展框架

核心概要

该工作提出一个多步骤框架,先用ChatGPT-4o做词切分纠正、再用词频阈值≥3的实体词典做上下文无关的实体补全,最后以基于频率的迭代自训练配合logits概率阈值与自注意力90百分位双阈值筛选伪标签、并用多语言XLM-RoBERTa-large按F1挑选候选,在乌尔都语MK-PUCIT、Shahmukhi(西旁遮普语)与信德语SiNER三个人工复核的验证/测试集上,微调XLM-RoBERTa-large后测试集micro-F1分别提升3.96、1.40、1.44个点,同时报告ChatGPT-4o零样本/少样本NER的表现低于有监督模型。

Source-provided article image: A Scalable Framework for Automated NER Annotation Correction in Low-Resource Languages
Figure 1 ·

Figure 1: Framework for NER Dataset Correction: An iterative process leveraging word segmentation correction, context-free entity augmentation, and iterative self-training with dual-threshold validation to enhance the annotation quality.

arXiv

深度剖析

提出基于频率的迭代自训练纠错流程,用于填补低资源NER数据集中的缺失标注。 相较以往主要针对高资源语料(如OntoNotes 5.0、CoNLL-03)且依赖Wikipedia等外部资源与专家标注的纠错工作,该流程面向低资源语言、无需人工重标注。 在三个人工复核的验证/测试集上评估,测试集micro-F1分别提升3.96、1.40、1.44个点;迭代轮次中MK-PUCIT与SiNER在第5轮、Shahmukhi在第9轮取得最佳macro-F1。

引入logits概率阈值与自注意力动态阈值(对角线自注意力分数的90百分位)的双阈值机制,以降低错误标注被传播的风险。 将置信度筛选同时施加于标签概率与自注意力分数,并配合基于排列的候选生成与多语言模型F1验证来选择最终标签序列。 附录A.2在Shahmukhi子集上比较0.75–0.95各百分位阈值下检出的实体数量(如0.95为359个、0.90为424个、0.75为451个),据此选择0.90百分位。

验证词切分纠正对基于Transformer的NER的影响,并展示因果LLM可用于改进非英语数据集质量。 指出波斯-阿拉伯书写系统中空格不一致会导致SentencePiece分词差异(示例中同一句由21个token变为17个token),并用ChatGPT-4o少样本提示在保持标注的前提下纠正词边界。 三个数据集在加入词切分纠正后验证集micro-F1均上升(MK-PUCIT 76.31→77.08,Shahmukhi 79.40→81.14,SiNER 86.70→87.11)。

为三个数据集准备并公开人工复核的验证与测试集,作为无偏评估基准。 评估集独立于标签传播过程,并用100句参考句计算标注者间一致性(Cohen's Kappa在0.9440–0.9765之间)。 验证/测试集规模与实体统计见表2,附录A.3给出人工修订前后各实体类型的数量变化。

启示与展望

该框架面向波斯-阿拉伯书写系统、实体类型为PER/LOC/ORG的低资源NER数据集,适用于希望在不进行人工重标注的前提下提升大规模噪声数据标注质量的场景;论文指出所选三种语言拓扑相关且文化相近,共享相似的人名、地名与机构名,因此跨语言表示可能有益。方法依赖实体词典(最低词频为3)与多语言XLM-RoBERTa-large验证器,并公开了各迭代版本数据供后续使用。

论文指出自动化标注质量取决于自训练模型与验证过程,初始伪标签中的错误可能在迭代中被强化,且流程完全自动、缺少人工标注者的语境理解,增强后的数据集仍可能残留标注不一致;此外实体数量增加本身不能证明每个新增标签正确,需结合干净测试集上的F1提升来判断。读者可进一步关注:双阈值在不同语言或实体类型上的稳定性、注意力阈值敏感性分析目前仅在Shahmukhi子集上进行,以及该流程在非拓扑相关语言上的表现。

来源