教育领域系统综述中的AI辅助数据提取:LLM准确性实证与人在回路工具AIDE
核心概要
该研究通过一项先导研究和一项主研究,用Claude 2.1、ChatPDF、GPT-4以及Gemini 1.5 Flash、Gemini 1.5 Pro、Mistral Large 2等LLM,从教育领域已发表综述的112项研究中提取显性变量与派生变量并与人工编码对比,发现LLM在提取显性数据时一致性较高但在按预设类别归类时明显下降、Cohen's Kappa普遍偏低,据此提出并开发了强制逐条人工验证的开源人在回路(HIL)数据提取工具AIDE。
Figure 1. LLM results for data extracted that were explicitly stated in the papers.
· 第 7 页深度剖析
在教育领域系统综述情境下,LLM提取显性陈述数据的准确率高于提取需按预设类别归类的派生数据。 此前多数LLM数据提取证据来自医学与医学相邻领域,教育领域证据有限;该研究以112项研究的较大语料在教育情境中复现并扩展了这一对比。 主研究中Gemini 1.5 Pro在显性数据上精确匹配一致率83.23%(k=0.40)、准确匹配85.02%(k=0.41),而派生数据精确匹配降至65.48%(k=0.24)、准确匹配70.24%(k=0.29),样本为112项研究、每项24个变量。
尽管精确率普遍较高,但LLM与人工编码者之间的一致性(Cohen's Kappa)未达到研究综述通常可接受的水平,因此不宜作为全自动主提取工具。 该研究不仅报告准确率,还系统报告精确率、召回率、F1与Kappa,并区分“精确匹配”与“准确匹配”,从而揭示高精确率掩盖下的一致性不足。 主研究精确率多在0.89–0.95之间,而召回率低至0.58–0.80,Kappa在0.12–0.41之间;混淆矩阵显示模型更倾向于提取不准确信息,而非在信息实际存在时标注“未报告”。
基于上述实证结果,作者提出并实现了强制逐条人工验证的人在回路(HIL)工作流与开源工具AIDE。 该工作把“LLM不可全自动信任”的实证结论转化为可操作软件:先由R版AIDE(本地运行、支持免费API与Ollama本地模型),再发展为网页版AIDE,采用结构化JSON解析替代正则、API密钥存于sessionstorage,并刻意不提供“一键全部记录”功能。 工具为免费开源并附GitHub仓库与OSF数据脚本;作者报告其非正式使用与同行反馈显示该流程可节省时间,但明确指出这属于轶事性证据,尚缺乏实证支持。
启示与展望
该结果适用于教育领域系统综述与元分析的数据提取环节,尤其是使用免费或本地可获取LLM、且愿意对每个数据点进行人工验证的研究团队;工具面向希望降低文本解析负担但保留人工判断的研究者,并建议在稿件中报告所用软件、所用LLM及人工验证程度。
作者指出AIDE节省时间、降低工作量与可用性等收益目前仅有轶事性证据,尚需量化研究;提示词、参数与模型差异对结果的影响使跨模型、跨情境推广需谨慎;教育领域尚无系统综述数据提取基准;更新一代前沿LLM的表现仍是开放问题;此外,本文为全文阅读,但图表以图像形式呈现,具体混淆矩阵数值只能依据正文文字描述理解。
