跳到主要内容
返回时间线
JB & JS open access来源发表:

髋膝关节置换中的生成式人工智能:患者沟通与教育、文档记录及决策支持三个临床域的系统综述

核心概要

该系统综述检索PubMed与Embase(2025年7月9日)并纳入23项研究,按患者沟通与教育(19项)、临床文档(2项)和临床决策支持(2项)三个域评估生成式AI(以ChatGPT 3.5/4为主)在髋膝关节置换中的应用:盲评显示其FAQ回答在准确性、清晰度和完整度上与外科医生回答相当而可读性更好;同意书起草在可读性与完整度上优于外科医生版本;手术记录信息抽取一致率达97.5%–100%;决策支持中手术适应证判断准确率较高但预后预测特异度低;同时存在引用虚构与患者信任不足的问题。

Source-provided article image: Generative Artificial Intelligence in Hip and Knee Arthroplasty: A Systematic Review of Emerging Clinical Applications in Patient Communication and Education, Documentation, and Decision Support.

Bar chart depicting yearly PubMed-indexed publications using the search string: (“ChatGPT” OR “large language model” OR “generative AI”) AND (“hip arthroplasty” OR “knee arthroplasty” OR “THA OR TKA”). There were 4 articles in 2023, 22 in 2024, and 21 in 2025 (as of July). THA = total hip arthroplasty and TKA = total knee arthroplasty.

PubMed

深度剖析

在患者沟通与教育域(19项研究),盲评临床医生评分显示ChatGPT生成的常见问题回答与外科医生撰写的回答在准确性、清晰度和完整度上相当,部分研究显示其在共情、准确性和整体质量上超过5位主刀医生中的3位("4.4/5 vs. <4; p < 0.001"),并能把教育材料从12年级改写至6年级阅读水平。 首次把分散在THA/TKA中的生成式AI研究按三个临床域集中整理,此前"no systematic review has evaluated generative AI use in THA/TKA specifically"。 以盲评Likert量表、DISCERN评分与可读性评分为主,跨研究异质性大,采用叙述性综合,未做正式偏倚评估。

在文档记录域(2项研究),ChatGPT-4从240份THA手术记录中提取固定方式、技术与入路信息的一致率分别为100%、98.9%与97.5%,其中87%的简短理由与原文一致;AI生成的风险-获益-替代知情同意书优于外科医生版本(阅读年级12.6 vs 16.8,完整准确度2.4/3 vs 1.8/3)。 把"手术记录信息抽取"与"知情同意书起草"两类文档任务放在关节置换语境中合并评估,提示可减少行政负担。 研究数量少(n=2),但报告了具体一致率与评分对比。

在决策支持域(2项研究),ChatGPT-3.5在32例单髁与全膝置换选择上与73名外科医生共识的一致率为84%(95% CI 0.67–0.94),敏感度91%、特异度70%(Cohen's κ=0.63);在80例TKA预后预测中敏感度97.4%但特异度仅33.3%,准确率65%,低于外科医生的90%/63%与76%。 揭示该域表现两极化:判断手术适应证较一致,但依据非结构化病历推断结局的特异度明显偏低,整体证据"mixed"。 样本量32例与80例,报告了置信区间与κ值,但未做正式偏倚评估。

信任与引用可靠性方面,患者偏好ChatGPT回答(53.8% vs 护士34.0%;另一研究69.4%),但92.1%与79.0%对在医疗场景信任AI持不确定态度;引用核查发现109条参考文献中仅35.8%有效、64.2%错误,另有一研究报告37%的引用为虚构或不可验证。 将患者信任与引用虚构并列为该领域落地的关键观察点,区分了医生审阅下风险可控的患者教育与更需溯源的决策支持。 来自问卷偏好统计与参考文献核验,属于描述性结果,未做前瞻性验证。

启示与展望

本综述面向髋膝关节置换的门诊与围手术期场景:可用于指导患者常见问题回答、教育材料改写、知情同意文档起草以及手术记录信息抽取;受众是关节置换外科医生、护士团队与医院信息部门。结果适用于以ChatGPT 3.5/4为主的英文文献环境,证据基础是人工评分与量表评测,而非真实临床工作流中的落地试验。

模型迭代速度快,原文提示"the results indicate at least 1-year-old performance";23项研究中仅3项评估ChatGPT之外的模型,跨模型比较有限;研究间方法、样本量与结局指标差异大,且未做正式偏倚或证据确定性评估;患者信任与HIPAA合规仍需前瞻性验证。本评审全文已载入,但补充材料(附录1与附录2)和图2未包含在文本中,筛选流程与逐项数据提取细节无法在此核对。

来源