孟加拉语医学NER基准:微调XLM-RoBERTa以F1 0.5959刷新纪录,语言专用BanglaBERT仅0.4937
核心概要
该工作对三种微调Transformer编码器(BanglaBERT、mBERT、XLM-RoBERTa)与GPT-4o mini的零样本和少样本提示配置在孟加拉语医学命名实体识别上进行大规模基准评测,覆盖全部3,179条测试样本,其中微调XLM-RoBERTa取得F1 0.5959,超过此前最佳0.5848,而语言专用的BanglaBERT仅得0.4937,且微调模型比最优提示配置高出3.76倍。
Figure 1. Overview of the unified experimental framework, showing
arXiv · 第 3 页深度剖析
微调XLM-RoBERTa在孟加拉语医学NER上取得F1 0.5959,超过此前报告的最佳结果0.5848,成为新的最优基线。 相较此前工作,该结果在完整测试集上给出可复现的基线,而非小样本子集上的估计。 基于全部3,179条测试样本的大规模评测,作者称其统计上稳健且可复现。
语言专用的BanglaBERT持续落后于多语言模型,F1仅为0.4937,说明在高度专业化的临床场景中,预训练领域的多样性可能比语言特异性更重要。 这一对比直接挑战了“语言专用模型在低资源语言任务中必然更优”的直觉,把语言特异性与领域多样性放在同一基准下比较。 三种编码器在同一任务与同一测试集上的对照评测,BanglaBERT与多语言模型之间存在明显差距。
按实体类型分析显示,Medicine与Specialist类别识别可靠,F1均高于0.83;Symptom类别最难,F1为0.4367,尽管它是训练集中出现最频繁的类别。 提供了该任务细粒度的按实体类型表现画像,揭示高频类别未必等于高识别率。 基于完整测试集的逐实体类型F1统计。
微调Transformer模型的表现是最优提示配置的3.76倍,表明仅靠提示的流程在低资源语言的临床结构化实体抽取上仍不充分。 将微调范式与GPT-4o mini的零样本、少样本提示配置直接量化对比,给出倍数级差距。 在相同任务上对微调模型与最优提示配置的比较,差距达3.76倍。
启示与展望
该基准面向孟加拉语医学命名实体识别这一具体任务,适用于低资源语言、临床实体抽取的研究与工程场景,为后续模型选择与评测提供可复现的对照基线。其结论针对所评测的三种编码器与GPT-4o mini提示配置,以及该任务的实体类型体系。
读者仍需留意:Symptom类别虽为训练集中最频繁类别却F1最低,其成因在文本中未展开;语言特异性与领域多样性之间的权衡是否在其他语言或临床任务中同样成立,尚待更多评测;此外,所载文本为摘要级内容,未包含数据构建细节、标注规范与统计检验信息,这些细节需查阅原文。
