急诊医学人工智能能力框架:一项多阶段共识研究
核心概要
该研究通过名义群体技术(2025年5月,n=6)与两轮改良德尔菲法(2026年4月至5月,专家组n=13,来自12家学术医学中心,第一轮应答率77%、第二轮100%)构建了美国首个专科特异性的急诊医学AI能力框架,最终形成5个主题(沟通AI、理解适用场景、与AI互动、AI风险管理、AI的认知影响)、5项派生能力(主题与能力一对一映射获13人中12人认可)、19个子主题和10个保留临床场景,所有主题、派生能力及被单独评分的子主题均达到预设共识阈值,10个场景中9个达到共识、1个作为未来态运行模型保留。
深度剖析
研究产出了一套以临床场景为锚点的急诊医学AI能力框架,包含5个主题、5项派生能力、19个子主题和10个保留临床场景,主题按“沟通AI—判断何时使用—实时协作—管理出错—保护自身推理”的临床接触弧线组织。 此前ACGME住院医师项目要求未提及AI,AAMC跨学习连续体的能力框架有意保持专科中立,医疗专业人员六域AI能力框架为全行业基线,尚无任何专科将其转化为本专科临床语境;该研究首次为美国某一医学专科提供专科特异性AI能力框架。 采用名义群体技术加两轮改良德尔菲法,专家组13人分布于12家学术医学中心,第一轮应答10/13(77%)、第二轮13/13(100%),预设共识阈值为场景≥70%评分≥4且IQR≤1、主题≥75%评为充分、派生能力与子主题≥70%评分≥4且IQR≤1,并按CREDES指南报告。
框架将“认知影响”单列为独立主题,涵盖认知自主与去技能化、锚定与自动化偏差、认知负荷与警报疲劳三个子主题,并明确区分“去技能化”与“从未习得技能”。 既有全行业框架虽承认锚定与自动化偏差,但未将认知自主与警报疲劳提升为独立的AI能力子域;该主题由第一轮中被评为最强未覆盖信号的两个候选缺口主题合并而成。 主题充分性均值4.27、91%评分≥4,主题名称获13人中12人认可;子主题T5b锚定与自动化偏差均值4.36、100%评分≥4,T5a与T5c均为4.18、91%评分≥4。
共识过程浮现出两条跨主题概念轴:一是“先发式”与“事后式”AI整合模式,二是分层能力作为被明确表达的需求而非预先设定的答案。 先发式整合(AI在临床医生完成独立推理前给出建议)与事后式整合(AI复核已完成工作)被配对场景S11与S17刻意呈现,二者在锚定、去技能化和“从未习得技能”方面具有不同认知含义;分层能力方面,第一轮显示医学生层面差异化支持较强(10人中7人支持实质性差异化),但会议决定只表达分层需求、不预先指定各阶段对应能力。 S11先发式AI咨询在第二轮均值4.18、91%评分≥4;S17事后式AI复核在第二轮均值3.82、55%评分≥4,处于临界但作为未来态运行模型保留;场景集整体充分性获91%认可(均值4.18)。
框架为急诊医学本科教育、毕业后教育和继续教育提供了结构性目标,并指出评估工具尚不存在,框架界定的是评估应测量的目标而非方法。 主题可映射到现有课程触点(临床推理、循证医学、职业素养、沟通、信息学),无需单独开发课程;在毕业后教育中,能力可作为住院医师里程碑开发的候选内容;在继续教育中,框架界定了师资发展模块的内容范围。 研究为共识性框架构建,未开展课程实施或评估工具验证;作者指出目前尚无任何专科具备支持AI能力评估使用的效度证据,工作场所评估被视为既定可信赖专业活动框架的自然延伸。
启示与展望
该框架面向急诊医学教育者、住院医师项目主任、医学院课程设计者与继续教育提供者,用于在AI增强的临床环境中界定课程、评估与师资发展的目标;其适用场景为美国急诊科中已实施或接近实施的AI应用,涵盖从分诊到处置的患者旅程,并明确以10个临床场景作为教育用途的覆盖范围而非穷举所有急诊遭遇。
德尔菲专家组为13人且集中于学术医学中心,来自社区实践与国际急诊医师的补充内容效度证据将影响外部效度;3名专家同时参与前置名义群体技术环节构成非独立性来源;主题2充分性评分最低(均值3.91),反映关于急诊医师所需机制理解深度的争论尚未完全消解;框架与2026年AI部署格局同步,大语言模型、环境记录与面向患者的AI快速演进可能需要按18至24个月周期再评估;框架只界定能力而不评估能力,操作示例在教育者间的评分者间信度尚未建立;此外,本文为预印本,尚未经过同行评审。
