ChatGPT 生成的盆腔器官脱垂手术决策辅助工具患者易懂性高,但约 30% 主题准确性不足且整体可读性偏高
核心概要
这项横断面研究由 6 名泌尿妇科医生设计 6 个比较两种常见泌尿妇科疾病治疗方案的问题并输入 ChatGPT 生成决策辅助工具,随后由患者和医生用患者教育材料评估工具评价易懂性、医生用改良 DISCERN 评价可靠性、用 5 点 Likert 量表评价准确性、用 Flesch-Kincaid 阅读易度评分评价可读性,结果显示所有工具的患者和医生易懂性均高,可靠性一般(平均 mDISCERN 26 分),2 个工具准确性低于 4 分(不利),整体所需阅读水平偏高。
深度剖析
ChatGPT 生成的泌尿妇科手术决策辅助工具在患者和医生两方评价中均获得高易懂性。 此前研究多评估人工智能生成患者教育材料,本研究把评价对象推进到面向具体手术决策的决策辅助工具,并同时纳入患者与医生两类评价者。 横断面研究,6 个由 6 名泌尿妇科医生开发的问题,患者与医生均使用患者教育材料评估工具评分,分析为描述性。
工具可靠性仅为一般,平均 mDISCERN 得分为 26。 在易懂性之外补充了医生对信息来源与质量维度的可靠性评价,使评价不局限于可读性。 由医生使用改良 DISCERN 工具评分,报告了平均分 26,分析为描述性。
6 个决策辅助工具中有 2 个准确性低于 4 分(不利),约 30% 的主题需要改进准确性。 把准确性作为独立维度量化,指出易懂并不等于准确,为后续改进提供具体靶点。 医生用 5 点 Likert 量表评价准确性,2 个工具得分低于 4,结论中表述为约 30% 主题需改进。
所有工具整体所需阅读水平偏高,可读性均有改进空间。 在易懂性评分之外引入 Flesch-Kincaid 阅读易度评分,揭示易懂性高与阅读难度高可以并存。 使用 Flesch-Kincaid Reading Ease 评分评价可读性,结论指出所有工具均可从改善可读性中获益。
启示与展望
本研究界定了 ChatGPT 生成泌尿妇科手术决策辅助工具在易懂性、可靠性、准确性和可读性四个维度上的表现,适用于由泌尿妇科医生提出问题、面向常见泌尿妇科疾病两种治疗方案比较的咨询场景。对希望探索人工智能辅助共享决策的临床团队而言,这一结果说明患者接受度可能不是主要障碍,后续工作可聚焦于提升可靠性与可读性,并在更广泛的疾病与人群中验证。
读者仍需关注:描述性分析未提供统计推断,6 个问题与 6 名泌尿妇科医生的规模有限,患者与医生评价者的具体人数与构成未在文本中给出,准确性低于 4 分的 2 个工具对应哪些主题也未说明。此外,ChatGPT 的具体版本与提问方式未在文本中描述,不同模型或提示方式下结果是否一致仍是开放问题。
