跳到主要内容
返回时间线
medRxiv来源发表:

StrokeAgent 在 100 例急性卒中病例中与专家最终决策一致率达 86%,高于无工具 LLM 与神经科医生

核心概要

研究提出 StrokeAgent——一个围绕时间对齐与持续信息综合构建的多模态智能体决策支持框架,可处理临床记录、实验室结果、原始心电图波形与源多模态 CT 图像,支持急诊分诊、初始溶栓决策与最终再灌注规划,并在 100 例富含复杂再灌注情境的多模态患者数据中与专家最终决策达成 86% 一致率,高于三个无工具大语言模型均值 13 个百分点、高于六名住院与主治神经科医生均值 17 个百分点,完整路径一致率为 76%,平均比病例层面神经科医生中位用时快 73.9 秒,且在 1200 次盲法临床医生评估中获得更高的总体临床效用评分与推理质量评分、更少被判定为存在严重潜在危害。

Source-provided article image: An auditable multimodal agentic system for sequential decision-making across the acute stroke pathway
Fig. 1 ·

Fig. 1 Overview of StrokeAgent. StrokeAgent processes clinical and imaging information directly from source data as it becomes available through three stage-specific agents for emergency triage, ini- tial thrombolysis decision and final reperfusion planning. At each stage, specialized tools and clinical subagents return structured findings to a shared case record, which the agent reasons over together with guideline-based rules and matched trial evidence to formulate a stage-specific recommendation. The upper panel shows an illustrative case progressing through the three decision stages. The lower panels summarize the agent decision cycle and the processing components available to the system. Illustration created with BioRender.com.

medRxiv · 第 5 页

深度剖析

StrokeAgent 被设计为围绕时间对齐与持续信息综合的多模态智能体决策支持框架,处理临床记录、实验室结果、原始心电图波形与源多模态 CT 图像,覆盖急诊分诊、初始溶栓决策与最终再灌注规划三个决策点。 与仅处理文本或单一模态的决策支持不同,该框架原生处理原始 ECG 波形与源 CT 图像,并随信息逐步到位而制定和更新建议,贴合急性卒中诊疗的时序性。 摘要描述了系统输入模态与三个决策点,并说明评估使用 100 例具有多模态临床与影像数据的患者,其中刻意富集了临床复杂的再灌注情境。

每条建议都锚定在可审计的支持性发现与证据链上。 在提供建议之外同时给出可追溯的证据链,使推荐结果可被核查,这是该框架区别于单纯输出结论的工具之处。 摘要明确表述建议“grounding each recommendation in an auditable chain of supporting findings and evidence”,但所加载文本未展示证据链的具体形式或示例。

在 100 例患者中,StrokeAgent 与专家裁定的最终决策一致率为 86%,高于三个无工具 LLM 均值 13 个百分点、高于六名住院与主治神经科医生均值 17 个百分点,且信息内容与时序相匹配;完整路径一致率为 76%,对两类对照组的优势更大。 比较在匹配信息内容与时序的条件下进行,并同时报告单点最终决策一致率与全路径一致率两个层次的结果。 摘要给出 86% 与 76% 两个一致率数字及 13、17 个百分点的差值,样本为 100 例经策划的多模态病例。

在 1200 次盲法临床医生评估中,StrokeAgent 的总体临床效用评分高于每一个 LLM(共同优势比 10.8 至 16.3),推理质量评分更高,且更少输出被判定为存在严重潜在危害;平均而言,它比病例层面神经科医生中位用时快 73.9 秒完成完整决策路径。 除与专家决策的一致性外,还引入盲法临床医生对临床效用、推理质量与潜在危害的评分,以及决策耗时这一维度。 摘要报告 1200 次盲法评估、共同优势比区间 10.8 至 16.3 与 73.9 秒的时间差,均为该研究自报的量化结果。

启示与展望

该工作面向急性缺血性卒中路径上的急诊分诊、初始溶栓决策与最终再灌注规划,使用者是需要在时间压力下整合临床与影像信息的急诊与神经科临床团队,尤其是专科 expertise 可及性有限的场景。它展示的是在 100 例经策划、刻意富集复杂再灌注情境的多模态病例上,与专家裁定决策的一致性与临床医生盲法评分,属于可行性层面的证据。若要向前推进,摘要指出需要前瞻性研究来确定医生监督下的使用是否改善临床照护;数据可用性声明也说明去标识化的个体层面数据因伦理、隐私与机构限制不公开,合格研究者可向通讯作者提交提案申请获取。

所加载文本为不完整的阅读范围,仅含摘要、利益冲突声明、作者声明与数据可用性声明,因此方法细节、病例构成、评估流程与统计模型均无法在此核实。摘要未说明三个无工具 LLM 与六名神经科医生的具体构成与经验分布,也未给出共同优势比所对应的具体评分量表与评估者数量分配。86% 与 76% 两个一致率分别对应最终决策与完整路径,其差异来源、以及 73.9 秒时间差在真实急诊流程中的意义,仍需结合方法部分判断。最关键的开放问题是:摘要明确指出需要前瞻性研究来确定医生监督下的使用是否改善临床照护,因此当前结果应视为可行性证据而非临床获益证据。

来源