DiagnosticXchange:面向临床AI系统的安全性、效率与诊断推理开源评估框架
核心概要
该研究开发并验证了开源临床模拟评估框架DiagnosticXchange,让AI系统在模拟医院中通过开具检查、申请影像和操作来诊断病例,并将每个动作映射到CPT编码以量化成本、时间、工作相对价值单位和侵入性;用8个大语言模型在19个专科的216个同行评审病例上完成1728次会话,结果显示三个系统准确率几乎相同(93.5%–94.0%)却在成本上差异显著(P<.001,最高与最低相差1.75倍)、医生监督需求相差2.1倍,最高效系统在5000美元内解决86%病例而最耗资源系统需10000美元才能达到同等准确率,无监督聚类识别出3种推理策略且行为特征比系统身份更能预测资源消耗(AIC 4683对50
深度剖析
提出并验证了一个开源、可复现的多维临床AI评估框架,将诊断动作映射到CPT编码以同时衡量准确率、成本、时间、侵入性和医生工作量。 相对于仅以准确率为核心的既有基准,该框架把临床资源消耗与安全性行为纳入同一评估流程,并公开为开源工具。 在8个大语言模型、19个专科的216个同行评审病例上完成1728次会话,并采用竞争风险生存分析、无监督聚类、诊断贡献评分和与14名神经科医生的试点比较等多种分析。
准确率相近的临床AI系统在成本与医生监督需求上可能存在临床上有意义的差异。 三个系统准确率仅相差0.5个百分点(93.5%–94.0%),但成本差异达1.75倍(P<.001)、医生监督需求相差2.1倍,说明准确率指标无法区分这些差异。 基于同一批病例的对照会话,成本差异具有统计学显著性(P<.001),并由竞争风险分析显示最高效系统在5000美元内解决86%病例、最耗资源系统需10000美元达到同等准确率。
AI系统的推理行为特征比系统身份更能预测资源消耗,且可被无监督聚类归纳为少数几种策略。 聚类识别出3种推理策略,行为特征预测资源消耗的AIC为4683,优于以系统身份预测的5056,提示评估应关注行为模式而非仅比较模型品牌。 基于1728次会话的行为数据进行无监督聚类与模型比较,AIC差异支持行为特征具有更好的预测力。
安全性分析揭示了准确率指标无法捕捉的临床风险行为,包括过早诊断、无贡献侵入性操作和失败病例上的无效侵入性操作。 在准确率之外量化了具体安全行为的发生率,为临床AI部署前的安全性评估提供了可操作的维度。 在216个病例的会话中统计到过早诊断最高9.3%、无贡献侵入性操作8.7%–29.9%、失败病例上的无效侵入性操作3.7%–18.1%。
启示与展望
该框架面向临床AI诊断系统的部署前评估,适用于在模拟医院环境中比较不同模型或系统在准确率、成本、时间、侵入性和医生工作量等维度的表现;其开源性质使其他研究者可在自有病例集和模型上复用。与14名神经科医生的比较属于试点性质,提示该框架可用于人机对比,但人机比较的适用范围需在更大人群和更多场景中进一步明确。
重测分析显示准确率可复现(84.6%一致)但流程变异较大(成本CV 86.6%),提示单次评估的成本结果可能不稳定,读者需关注多次运行下的成本分布。与14名神经科医生的比较为试点,其结论的推广范围尚不明确。此外,模拟医院环境与真实临床流程之间的差异如何影响成本、侵入性和安全行为指标,仍是需要进一步观察的问题。
