跳到主要内容
返回时间线
PLOS digital health来源发表:

面向精神分裂症患者信息获取的医疗问答系统构建指南

核心概要

该研究提出一套以公开在线健康论坛为数据来源、结合主题引导语义建模(TGSM)与检索器-阅读器两阶段流水线的方法,构建了包含415,602条帖子、35个主题、1,050个问答对的精神分裂症问答数据集,并显示在该数据集上微调后的BioBERT在精确率与精确匹配等指标上优于未微调版本及DistilBERT等基线。

Source-provided article image: Assisting patients with reliable information gathering: A guide to building efficient QA systems for medical use.
PubMed

深度剖析

提出从公开精神健康论坛(The Mental Health Forum精神分裂症子版)抓取并去标识化处理患者自述文本,构建低机构性偏倚、注重隐私的领域问答语料。 相较依赖临床病历、医患对话或医学考试题等来源的既有做法,该路径直接使用患者自然表达的内容,作者将其界定为在比较方法学意义上减少机构与诱导偏倚,而非消除全部抽样偏倚。 语料规模明确为415,602条帖子,处理流程包括删除用户名、剔除直接身份标识、仅保留文本内容;作者同时说明论坛参与本身存在自选择,因此偏倚降低是相对的。

将TGSM用于自动识别主题与方面,把全量语料组织为35个主题簇与约300个方面,从而把标注空间从整个论坛档案缩小到语义组织后的主题段落。 相较标准LDA或纯嵌入聚类,TGSM被显式嵌入下游问答构建流程,主题不仅用于事后解释,还用于结构化标注空间并生成问题线索,且以高概率词或短语呈现主题-方面关联,便于标注者理解。 主题数通过留出集困惑度与主题连贯性的人工检查共同确定,35个主题被认为在可解释性与困惑度最小化之间取得平衡;作者报告较少主题会合并幻觉、药物影响与社会功能等不同关切,过多主题则产生碎片化或冗余主题。

构建了包含1,050个问答对的精神分裂症问答数据集,每个主题簇30个问答对,并允许一个问题对应多个由段落证据支持的答案。 相较只支持单一答案的COVID-QA等数据集,该数据集保留患者经验中多种有效表达,标注标准要求问题基于连贯的主题-方面关联、答案由对应段落证据明确支持。 数据集构建被描述为主题引导的抽样与标注过程,而非把全部帖子压缩为少量段落;具体统计信息在表2中,但该表内容未在文本中展开。

实现检索器-阅读器两阶段问答流水线,并在精神分裂症问答数据集上微调BioBERT、RoBERTa与DistilBERT,其中微调后的BioBERT在各数据集与指标上表现最佳。 相较仅使用预训练模型,微调带来明显提升;在精神分裂症问答数据集上,基础BioBERT与微调版本相比精确率提升14.30%,精确匹配从0.427升至0.617,提升34.4%;与最轻量的DistilBERT相比,微调BioBERT精确率提升32.59%。 评估使用精确率、召回率、F1与精确匹配四项指标,测试集为全部问答数据的30%,训练使用900个问答对即70%数据;在MHQA上微调BioBERT精确率0.781、F1为0.772,在PubMedQA上精确率达0.816。

启示与展望

该框架面向以公开论坛患者自述文本为来源、针对特定疾病(此处为精神分裂症)构建问答数据集与检索器-阅读器问答系统的场景,适用于希望以较低隐私风险与较低标注成本获得领域问答资源的研究者与开发者;作者指出该方法可扩展至更广泛的精神健康状况与患者人群,并可用于为更多疾病高效创建问答数据集。

作者明确指出,如何系统确保论坛内容的可靠性、准确性与临床相关性仍是未解决的挑战,未来可探索自动或半自动的临床相关内容验证与过滤方法;此外,将框架复制到多种精神健康领域需要系统识别合适论坛,自动问题生成等加速手段的实际效果也有待检验。本文为全文阅读,但表2至表5的具体数值与示例未在正文中展开,若需核对数据集统计、超参数与逐项指标,仍需查阅原表。

来源