medRxiv 2026年9月20日该研究构建了一个概念验证型信息抽取流程,用Athena-v3-AWQ、Gemma3-27B和Llama-3.1-70B-Instruct三个开源大模型从CZI DRSM语料库中标注为“2”的PubMed摘要(金标准集148篇、全语料3,547篇)中抽取11项自然史研究特征,结果显示三个模型成功率均超过99%,Gemma在专家评分(68.0%输出被评为“good”)和全语料运行时间(约16分钟)上综合最优,而Llama在自动Token F1上更高(0.874对0.723),Athena表现最差主要因其倾向逐字复制原文而非综合归纳。该研究构建了一个概念验证型信息抽取流程,用Athena-v3-AWQ、Gemma3-27B和Llama-3.1-70B-Instruct三个开源大模型从CZI DRSM语料库中标注为“2”的PubMed摘要(金标准集148篇、全语料3,547篇)中抽取11项自然史研究特征,结果显示三个模型成功率均超过99%,Gemma在专家评分(68.0%输出被评为“good”)和全语料运行时间(约16分钟)上综合最优,而Llama在自动Token F1上更高(0.874对0.723),Athena表现最差主要因其倾向逐字复制原文而非综合归纳。面向罕见病研究的LLM自然史研究信息抽取流程该研究构建了一个概念验证型信息抽取流程,用Athena-v3-AWQ、Gemma3-27B和Llama-3.1-70B-Instruct三个开源大模型从CZI DRSM语料库中标注为“2”的PubMed摘要(金标准集148篇、全语料3,547篇)中抽取11项自然史研究特征,结果显示三个模型成功率均超过99%,Gemma在专家评分(68.0%输出被评为“good”)和全语料运行时间(约16分钟)上综合最优,而Llama在自动Token F1上更高(0.874对0.723),Athena表现最差主要因其倾向逐字复制原文而非综合归纳。该研究构建了一个概念验证型信息抽取流程,用Athena-v3-AWQ、Gemma3-27B和Llama-3.1-70B-Instruct三个开源大模型从CZI DRSM语料库中标注为“2”的PubMed摘要(金标准集148篇、全语料3,547篇)中抽取11项自然史研究特征,结果显示三个模型成功率均超过99%,Gemma在专家评分(68.0%输出被评为“good”)和全语料运行时间(约16分钟)上综合最优,而Llama在自动Token F1上更高(0.874对0.723),Athena表现最差主要因其倾向逐字复制原文而非综合归纳。