跳到主要内容
返回时间线
Journal of Chemical Information and Modeling来源发表:

自动生成磁性材料领域问答数据集以支撑高性能语言模型

核心概要

本文提出一种自动生成领域问答数据的方法,构建了包含168,080个磁性材料问答对的数据集MagQA,并用它微调BERT类模型;在人工标注的磁性材料测试集上,将MagQA与SQuAD v2混合微调的vanilla BERT-base-cased(MagBERT_MagQA_Mixed)取得F1 78.43%、精确匹配72.84%的最佳成绩,表明在拥有足够大规模高质量领域问答数据的前提下,领域专用BERT模型无需领域自适应预训练,仅从vanilla BERT微调即可。

Source-provided article image: Autogenerating a Domain-Specific Question-Answering Data Set to Enable High-Performing Language Models for Magnetic Materials.
1 ·

MagBERT workflow presented in this study. Abbreviations used for visual clarity denote Artificial Intelligence (AI), Bidirectional Encoder Representations from Transformers (BERT), ChemDataExtractor (CDE), Domain-Adaptive Pretraining (DAPT), Question-Answering (QA), our magnetic QA data set (MagQA) developed herein and the Stanford Question-Answering Data set, version 2 (SQuAD v2) that contains QA pairs that have been constructed from generic English language.

PubMed

深度剖析

提出可自动生成领域问答数据集的流水线,并据此构建了168,080个磁性材料问答对的MagQA数据集。 针对领域专用问答数据稀缺、人工标注成本高的问题,提供了可扩展的自动生成方案,而非依赖人工逐条编写。 论文以该数据集规模(168,080问答对)和后续微调实验作为支撑,属于方法加数据构建类证据。

在磁性材料问答任务上,将MagQA与SQuAD v2混合微调的vanilla BERT-base-cased(MagBERT_MagQA_Mixed)表现最佳,F1为78.43%、精确匹配为72.84%。 在6个BERT-base-cased模型的对比中,混合领域数据与通用问答数据优于仅用单一数据集的配置,且该最佳模型未经过领域自适应预训练。 结果基于人工标注的磁性材料测试集,并给出F1与精确匹配两项指标,属于有明确评测基准的实证结果。

领域自适应预训练并非领域专用BERT模型的必要条件:vanilla BERT-base-cased仅经MagQA与SQuAD v2混合微调即可达到最佳性能。 与需要先在97,308篇磁性论文语料上做领域自适应预训练再微调的3个模型相比,该结论说明在足够大规模高质量领域问答数据可用时,可省去领域自适应预训练环节。 论文通过对比3个vanilla模型与3个经领域自适应预训练模型的相对性能得出该结论,属于受控对比证据。

通过四种规模问答数据集的消融实验,考察了实现充分领域特化所需的数据量,并展示了方法可外推到RoBERTa-base与DeBERTa-base等更大架构。 不仅给出单一最佳配置,还提供了数据规模与领域特化程度之间关系的经验观察,并说明流水线不局限于BERT-base。 消融实验覆盖四种数据规模,外推部分为架构层面的可行性展示,证据强度弱于主对比实验。

启示与展望

本文结果面向磁性材料领域的问答任务,适用于拥有足够大规模、高质量领域问答数据并希望以较低算力成本构建领域专用BERT类模型的场景;方法被展示可外推到RoBERTa-base与DeBERTa-base,但主要评测仍以BERT-base-cased为基准,且最佳配置依赖MagQA与SQuAD v2的混合使用。

自动生成问答对的质量控制细节、人工标注测试集的规模与标注一致性、以及消融实验中四种数据规模的具体取值,在本文摘要层面未展开;此外,领域自适应预训练语料为97,308篇磁性论文,其覆盖范围与领域边界如何影响结论的外推性,仍是值得进一步观察的问题。

来源