跳到主要内容
返回时间线
Neurourology and Urodynamics来源发表:

尿动力学报告撰写器(URapp):基于GPT-4o的尿动力学解读与报告草稿生成应用

核心概要

该研究开发并验证了基于GPT-4o的尿动力学报告撰写器应用(URapp),其依据科学文献与国际尿动力学指南建模、经两家转诊中心检查数据由两位专家监督微调,由功能泌尿科专家按0-5分Likert量表评估,在解读准确性(4.5±0.2)、概念解释(5.0±0)、循证标准依从性(4.8±0.3)、建议清晰实用性(4.2±0.3)、临床相关性(3.8±0.3)和诊断有用性(3.5±0.5)等维度获得较高评分,并在100例连续尿动力学检查(中位年龄61岁)中全部获得总体评分≥4。

AI-generated editorial illustration: Development and Validation of Urodynamic Report Writer: A Chat GPT App.

深度剖析

研究构建了URapp这一GPT-4o虚拟助手,用于支持对临床医生提供的尿动力学数据进行解读并生成报告草稿。 相对于依赖人工、耗时且操作者依赖的传统尿动力学解读与报告流程,该工作将大语言模型引入这一具体临床环节,并以国际尿动力学指南和科学文献作为建模依据。 开发历时约6个月,训练使用来自多家转诊中心的尿动力学检查,并由两位专家尿动力学医师进行监督微调。

在功能泌尿科专家使用0-5分Likert量表的验证中,URapp在多个评估维度上获得高分。 该验证提供了对解读准确性、概念解释、循证依从性、建议清晰实用性、临床相关性和诊断有用性的分维度量化评分,而不仅是整体印象。 解读准确性4.5±0.2、概念解释5.0±0、循证标准依从性4.8±0.3、建议清晰与实用性4.2±0.3、临床相关性3.8±0.3、诊断有用性3.5±0.5。

在最终阶段,URapp为100例连续尿动力学检查生成报告,并由两位专家泌尿科医师独立评估,全部病例总体评分≥4。 该阶段将评估从专家评分扩展到连续病例样本,提供了对连续入组病例表现的观察。 连续样本100例,中位年龄61岁,由两位专家泌尿科医师独立评估,全部获得总体评分≥4。

启示与展望

该结果面向支持尿动力学解读与报告草稿生成的临床场景,适用于由临床医生提供尿动力学数据、由URapp辅助解读并生成报告草稿的工作流程;作者指出其可能支持标准化、遵循指南的尿动力学报告,但明确表示在常规临床实施前需要前瞻性多中心研究。

作者列出的局限包括回顾性设计、样本量有限以及缺乏前瞻性临床结局评估,因此该工具对实际患者结局的影响仍是待解问题;此外,本次加载文本为摘要级内容,未包含图表与完整方法细节,评分分布、评估者间一致性以及训练数据构成等具体信息无法从现有文本确认,需查阅原文进一步了解。

来源