面向混凝土材料信息学的大语言模型自动化数据抽取流水线
核心概要
该工作提出一条由大语言模型驱动的模块化智能体流水线,从科学文献的表格与正文中自动抽取并结构化混凝土材料的组成—工艺—性能属性,在17个开源与专有模型上取得最高0.98的F1分数,并在约一小时内从超过27,000篇文献筛选出的278篇论文中抽取逾10,000条记录,经后处理形成含近9,000条高质量记录、100余项属性的迄今最大公开掺合水泥混凝土实验室数据库,机器学习分析进一步显示大规模、多样且信息丰富的数据库可同时提升分布内精度与对未见材料体系的分布外泛化。
Fig. 1 | Survey of dataset sizes used in peer-reviewed publications applying
· 第 2 页深度剖析
提出由抽取智能体与处理智能体组成的顺序模块化LLM智能体链,同时处理表格与正文,并完成缩写展开、表头合并、单位归一化、命名标准化、记录级合并等清洗工作。 相较依赖固定规则或需大量人工标注语料的ChemDataExtractor、MatSciBERT等传统文本挖掘方法,该流水线无需领域或任务特定微调即可适应异构报告格式,并把此前主要局限于文本抽取的LLM应用扩展到表格与跨段落信息整合。 以58篇随机选取、覆盖不同期刊与出版社的论文人工抽取的3,015条记录为基准,在17个LLM上评测五类目标信息;多数模型各类别F1达0.90以上,全部17个模型总体F1高于0.85,12个超过0.90,8个超过0.95,最高为Claude Sonnet 4.5的0.98;GPT-4o总体精确率0.98、召回率0.96、F1 0.97。
构建了掺合水泥混凝土抗压强度领域迄今最大的公开实验室数据库,共8,979条唯一高质量记录、100余项属性,覆盖粉煤灰、矿渣、硅灰、石灰石粉与煅烧黏土五种辅助胶凝材料。 此前文献报道的最大数据集为Jiang等的5,026条记录但未公开,公开数据集中Imran等为2,171条,而领域内最广泛使用的Yeh数据集仅1,030条且只涉及两种辅助胶凝材料、来自17篇文献;本数据库来自278篇文献,包含3,121种唯一配合比,水胶比覆盖0.09–2.2,并首次系统纳入原材料氧化物组成、烧失量、比重与Blaine细度等化学与物理描述符。 从10,313条自动抽取记录经去重、剔除非目标辅助胶凝材料与异常总质量等后处理得到;超过120篇论文经交叉核对,加上58篇人工抽取基准论文,合计覆盖逾7,500条记录,占最终数据库80%以上。
机器学习分析表明,纳入胶凝材料化学与物理描述符可小幅提升分布内预测精度,且CaO含量与Blaine细度是除养护龄期和水胶比之外的重要特征。 以往混凝土强度预测数据集普遍缺失胶凝材料化学与物理属性(调查显示超过90%的文献数据集缺少此类描述符),该工作首次在近9,000条记录规模上系统评估这些描述符的贡献。 在随机80/20划分、10个不同随机种子的重复实验下,以XGBoost、随机森林、LightGBM、多层感知机、支持向量机及线性回归基线对比,加入五种主要氧化物与Blaine细度后各模型均有轻微至中等提升;SHAP分析显示CaO含量位居最重要特征之列。
训练数据规模与分布外泛化实验显示,预测精度随训练数据量近似呈幂律提升,且加入少量目标域样本即可显著改善对三元与四元掺合体系的泛化,而化学与物理描述符可减少所需新增实验样本数。 该工作把深度学习中观察到的神经缩放规律类比到混凝土强度预测,并量化了描述符对降低实验成本的贡献,为数据驱动混凝土设计提供了可操作的证据。 分布外任务以仅含普通硅酸盐水泥与二元掺合体系的训练集预测三元、四元体系强度,XGBoost基础特征RMSE即使在全训练集下仍超过14 MPa;加入目标域样本后明显改善,达到10 MPa RMSE在使用描述符时约需50个额外样本,不使用则需100个以上。
启示与展望
该流水线面向XML或HTML格式的全文文献,聚焦掺合水泥体系中以单位体积质量报告的配合比,抽取范围限于胶凝材料属性、配合比、养护条件、试件尺寸与抗压强度,数据库覆盖粉煤灰、矿渣、硅灰、石灰石粉与煅烧黏土五种辅助胶凝材料。作者指出该框架可扩展至其他混凝土技术与材料体系,并可持续应用于新发表文献以实现数据库的持续扩充与更新。
流水线在算术计算与单位换算上仍会出现偶发错误,例如把‘0.5% of binder mass’当作‘0.5 × binder mass’,或把‘0.56 m2/g’误转为‘5.6 m2/kg’;复杂表头与合并单元格可能导致列错位;超长表格受最大输出token限制可能被截断。文献侧则存在缩写未定义(如‘FA’可指粉煤灰或细骨料)、关键信息缺失(近30%文献未在表格报告胶凝材料属性,36%与16%分别缺少养护条件与试件尺寸的明确报告,34%未在表格报告配合比,超过60%未在表格报告抗压强度而多置于图中)以及源文献单位不一致、笔误与数据录入错误等问题。作者也指出当前评测为端到端整体评测,未逐一分离各中间步骤的误差来源,且图表与补充材料中的信息尚未纳入抽取范围。
