FetalAgents 用多智能体编排胎儿超声专家模型,在八项临床任务的外部验证中取得最优表现并自动生成结构化报告
核心概要
该工作提出 FetalAgents——一个基于 AutoGen 构建的多智能体系统,由 GPT-5-mini 驱动的 Coordinator 解析临床意图与解剖平面并动态调度专家智能体,专家智能体以确定性融合规则组合 FetalCLIP、nnU-Net、USFM、SAMUS、AoP-SAM 等专用视觉模型,Summarizer 汇总为结构化报告;在多中心外部数据集的八项临床任务(标准平面分类、脑平面分类、腹部与胃分割、AoP 估计、AC 与 HC 测量、GA 预测)上,FetalAgents 相比专用视觉模型、超声基础模型与通用/医学 MLLM 取得最优或最具竞争力的结果,并支持端到端视频流关键帧提取与报告生成。
深度剖析
FetalAgents 将胎儿超声分析组织为 Coordinator、Experts、Summarizer 三类智能体,Coordinator 基于 GPT-5-mini 将用户查询分类为任务类型并识别标准超声平面,再改写为结构化提示并动态分派给相关专家;专家智能体封装任务专用视觉模型并以确定性融合规则输出结果,且仅通过结构化 JSON 向上游通信。 既有自动化模型多为单一子任务的独立预测器,需要临床医生手动选择工具并把预测转写为结构化文档;该工作把工具选择、解剖上下文识别与结果汇总纳入一个语言驱动的协调框架。 方法描述完整,给出了三类智能体的职责、所集成的具体模型(FetalCLIP、FU-LoRA、RadImageNet 初始化的 ResNet-50、ViT-B/16、nnU-Net、USFM、SAMUS、AoP-SAM、UperNet、ConvNeXt-Tiny)以及融合与通信机制;系统构建于 AutoGen 框架之上。
在多中心外部验证的八项临床任务上,FetalAgents 取得最优或最具竞争力的结果:标准平面分类准确率 0.927、Cohen's κ 0.903(FetalCLIP 为 0.914/0.887);脑平面分类 F1 0.896、κ 0.856;腹部分割 DSC 0.937、HD95 2.32;胃分割 DSC 0.859、HD95 10.64;AC 测量 MAE 5.53 mm、Acc@5% 84.0%;HC 测量 MRAE 1.40%、P95 RAE 3.75%;GA 预测有效率 84.93%、MAE 1.23 周;AoP 估计 MAE 5.44°、Acc@5% 67.2%。 论文报告称其在八项任务上一致优于专用视觉模型、超声基础模型以及通用与医学 MLLM;例如 GPT-5-mini 在标准平面分类上准确率仅 0.605,MedGemma 为 0.708,Gemini-3-flash 为 0.880。 结果来自独立外部数据集(如多中心非洲数据、511 例 HC18 子集等),覆盖 233 例标准平面、569 例脑平面、187 例腹部、253 例胃、64 例 AoP、187 例 AC、75 例 HC、511 例 GA 预测;指标包括 Accuracy、F1、Cohen's κ、AUROC、DSC、IoU、HD95、ASSD、PPV、Sensitivity、MAE、MdAE、MRAE/MdRAE、P95 AE/P95 RAE、Acc@5% 与 Validity Rate。
系统支持端到端视频流摘要:使用 FetalCLIP 编码器骨干微调一个 6 类关键帧识别模型,自动从连续视频中抽取诊断关键帧,分派相应专家逐帧分析,并将时序发现聚合为视频级临床报告;在图像描述生成中,系统用 WHO 胎儿生长曲线计算生长百分位,作为一致性保障,当测量值超出合理生长范围时触发对专家输出的反思步骤并替换离群值。 既有模型通常只处理单帧单任务,把关键帧提取与文档记录留给人工;该工作把关键帧识别、逐帧分析与报告聚合串成一条流水线,并引入基于生长曲线的自动一致性检查。 关键帧模型在 PBF-US1 上微调;定性评估(Fig. 2)显示系统在图像描述中正确识别 trans-thalamic 平面并生成与人类专家一致的报告,在视频摘要中自动提取多平面关键帧并将超声推导的 GA 与 LMP 推导的 GA 交叉核对。
启示与展望
该结果面向胎儿超声的产前筛查与结构评估场景,适用于需要把平面分类、解剖分割与生物测量串成完整流程的临床工作流,也适用于把连续超声视频自动整理为结构化报告的场景。对希望复用该框架的研究者而言,系统以 AutoGen 为底座、以公开数据集训练各专家模型,代码已开源,可作为把专用视觉模型编排为多步骤工作流的参考实现;对临床读者而言,其价值在于展示了一条从图像或视频到可审计结构化报告的自动化路径,其中 WHO 生长曲线百分位被用作测量一致性的自动检查点。
报告生成部分(图像描述与视频摘要)以定性示例呈现,缺少与人类专家报告的系统性量化对比,因此其报告质量在多大程度上可复现仍需更多证据。GA 预测的有效率指标依赖 WHO 生长曲线作为参考,其在不同人群中的适用性会影响该指标的解读。系统集成了多个外部模型与数据集,各专家在分布外数据上的表现差异如何传导到最终报告,文本未逐一拆解。论文将前瞻性临床评估与更长期患者病史的整合列为未来工作,说明当前证据主要来自回顾性外部验证。
