跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

medRxiv

面向临床神经病学预后研究系统评价的风险偏倚评估大语言模型

该研究采用零样本提示构建了一个模拟人类评审者的LLM流程,用于QUIPS框架下的风险偏倚评估,并将其应用于既往系统评价中纳入的298篇神经病学预后研究文章(涵盖癫痫、创伤性脑损伤、卒中三个领域),结果显示LLM与人类评估者之间的一致性有限(加权kappa=0.22,95%CI 0.12-0.33),而基于小样本(n=5)的初步数据提示其可能不劣于人类评估者之间的一致性(加权kappa=-0.25,95%CI -1.04-0.54),Wilcoxon符号秩检验在四个偏倚领域及总体风险评分上均具有统计学显著性(p<0.05),秩双列相关显示人类评估者倾向于给出比LLM更高的风险评分。