面向临床神经病学预后研究系统评价的风险偏倚评估大语言模型
核心概要
该研究采用零样本提示构建了一个模拟人类评审者的LLM流程,用于QUIPS框架下的风险偏倚评估,并将其应用于既往系统评价中纳入的298篇神经病学预后研究文章(涵盖癫痫、创伤性脑损伤、卒中三个领域),结果显示LLM与人类评估者之间的一致性有限(加权kappa=0.22,95%CI 0.12-0.33),而基于小样本(n=5)的初步数据提示其可能不劣于人类评估者之间的一致性(加权kappa=-0.25,95%CI -1.04-0.54),Wilcoxon符号秩检验在四个偏倚领域及总体风险评分上均具有统计学显著性(p<0.05),秩双列相关显示人类评估者倾向于给出比LLM更高的风险评分。
深度剖析
研究证明了定制化、提示工程化的LLM流程在QUIPS工具下自动化风险偏倚评估的可行性。 此前LLM在系统评价自动化中的应用多集中于其他环节,本研究首次将零样本提示的LLM流程专门设计为人类评审者在QUIPS框架下的虚拟模拟,并聚焦于神经病学预后研究这一单一学科。 基于298篇来自15篇系统评价的文章,覆盖癫痫、创伤性脑损伤、卒中三个领域,展示了流程的可行性,但未报告流程构建的具体技术细节。
LLM与人类评估者之间的风险偏倚评估一致性有限,加权kappa为0.22(95%CI 0.12-0.33)。 提供了LLM在QUIPS框架下与人类评估者一致性的定量估计,此前缺乏此类针对预后研究风险偏倚评估的LLM-人类一致性数据。 基于298篇文章的评估数据,置信区间较窄,但一致性水平本身较低。
基于小样本(n=5)的初步数据提示LLM-人类一致性可能不劣于人类-人类一致性(加权kappa=-0.25,95%CI -1.04-0.54)。 首次在QUIPS框架下同时比较LLM-人类一致性与人类-人类一致性,为LLM评估的相对表现提供了初步参照。 样本量极小(n=5),置信区间极宽,作者明确表述为'tentatively suggest',证据强度有限。
Wilcoxon符号秩检验在四个偏倚领域及总体风险评分上均具有统计学显著性(p<0.05),秩双列相关显示人类评估者倾向于给出比LLM更高的风险评分。 揭示了LLM与人类评估者在风险评分分布上的系统性差异方向,即人类倾向于给出更高的风险评分。 基于298篇文章的配对比较,统计检验显著,但效应方向的具体含义需结合QUIPS框架的评分标准理解。
启示与展望
该研究为LLM在QUIPS框架下自动化风险偏倚评估提供了可行性证据,适用于神经病学预后研究(癫痫、创伤性脑损伤、卒中)的系统评价场景。作者指出,经过针对性方法学改进——包括QUIPS实施的标准化和针对专家评分的验证——自动化风险偏倚评估可能显著降低神经病学及其他领域预后研究系统评价的时间与成本。该流程的潜在受益者包括系统评价作者、研究方法学家及循证医学实践者。
LLM-人类一致性有限(加权kappa=0.22),人类-人类一致性比较仅基于n=5的小样本,置信区间极宽(-1.04至0.54),这些因素使得LLM评估是否不劣于人类评估的结论尚不确定。人类评估者倾向于给出更高风险评分的系统性差异,其来源和影响有待进一步探究。此外,该研究为摘要级别的快速解析,缺少流程图、表格及QUIPS各领域详细评分分布等数据,这些信息的缺失影响了对评估细节的完整理解。QUIPS实施的标准化和针对专家评分的验证是作者提出的关键后续方向。
