跳到主要内容
返回时间线
arXiv来源发表:

OncoVision 用注意力多模态训练框架,在六位放射科医师配对评估中把阅片时间最多缩短 61%,并提升诊断信心

核心概要

OncoVision 是一个特权信息训练框架:训练时同时使用乳腺 X 线摄影图像与临床特征,推理时仅依赖乳腺摄影图像,采用基于注意力的编码器-解码器骨干,联合分割四个感兴趣区域(肿块、钙化、腋窝所见、乳腺组织)并预测十项结构化临床特征(含 BI-RADS 分类),其分割准确率超过 nnU-Net 基线;作者提出 Independent 与 Dependent 两种晚期融合策略,在训练中整合影像、影像组学与临床信息,并从预测掩膜提取形状、强度、纹理等影像组学描述符以补充 CNN 表示;在六位委员会认证放射科医师参与的回顾性多阅片者研究中,配对阅片辅助评估显示该工具与初级和资深放射科医师更高的诊断信心相关,阅片时间最多减少

Source-provided article image: OncoVision: Integrating Mammography and Clinical Data through Attention-Driven Multimodal AI for Enhanced Breast Cancer Diagnosis
Fig. 1 ·

Fig. 1 : Integrated workflow and multimodal architecture of OncoVision. (a) Integrated workflow from data acquisition and preprocessing to model training, evaluation, and web deployment. (b) Independent variant: raw clinical features and radiomic descriptors are concatenated with imaging-derived bottleneck features during training. (c) Dependent variant: clinical features are processed through a dedicated encoder before fusion with imaging and radiomic features. At inference, externally supplied clinical features are omitted, while radiomic features are generated internally from the predicted segmentation masks.

arXiv

深度剖析

OncoVision 采用特权信息训练:训练阶段同时输入乳腺摄影图像与临床特征,推理阶段仅从乳腺摄影图像出发生成结果。 与推理时仍需多模态输入的常见多模态方案不同,该设计把临床信息的价值压缩进图像模型,使部署端只需乳腺摄影图像。 摘要明确描述该训练与推理的不对称设定,并说明其基于注意力的编码器-解码器骨干;未给出具体数据集规模或统计检验细节。

该模型联合分割四个感兴趣区域(肿块、钙化、腋窝所见、乳腺组织),分割准确率超过 nnU-Net 基线,并同时预测十项结构化临床特征,包括 BI-RADS 分类。 把分割与结构化临床特征预测放在同一注意力编码器-解码器框架内完成,而非只做单一分割或单一分类任务。 摘要给出与 nnU-Net 基线的对比结论,但未列出具体分割指标数值或置信区间。

作者提出 Independent 与 Dependent 两种晚期融合策略,在训练中整合影像、影像组学与临床信息,并从预测掩膜提取形状、强度、纹理描述符以补充 CNN 表示。 将影像组学特征建立在模型自身预测的掩膜之上,使手工描述符与学习到的 CNN 表示形成互补,而非仅依赖原始图像特征。 摘要说明两种融合策略与影像组学特征类别,但未报告各策略之间的定量比较结果。

在六位委员会认证放射科医师参与的回顾性多阅片者配对辅助评估中,OncoVision 与初级和资深放射科医师更高的诊断信心相关,阅片时间最多减少 61%,对肿块病灶的分割准确率与放射科医师相当或更高。 以多阅片者配对设计同时考察诊断信心、阅片时间与分割准确率三项指标,而非仅报告算法内部指标。 摘要给出阅片者人数(六位委员会认证放射科医师)、研究类型(回顾性多阅片者研究)与量化结果(阅片时间最多减少 61%),但未提供样本量、置信区间或显著性检验。

启示与展望

该工作面向乳腺摄影解读场景:训练阶段可利用临床特征,部署阶段仅需乳腺摄影图像,因此适用于临床特征在训练时可得、而推理端希望保持单模态输入的机构。其多阅片者评估为回顾性配对设计,参与者为六位委员会认证放射科医师,评估指标为诊断信心、阅片时间与分割准确率,因此结论适用于这一评估设置下的阅片辅助。系统已实现为安全网页应用并部署于合作医院,生成带双置信度评分与注意力加权可视化的结构化报告,作者将其定位为可整合进临床工作流、并支持欠发达地区筛查可及性的平台。

摘要未报告数据集规模、病例构成、外部验证或多中心数据情况,因此诊断信心提升、阅片时间最多减少 61% 与肿块分割准确率相当或更高这些结果在更广人群与设备条件下的表现仍是开放问题。摘要也未给出两种晚期融合策略之间的定量比较、影像组学描述符的具体贡献,以及双置信度评分与注意力加权可视化在临床决策中的实际作用。此外,摘要提到分割准确率超过 nnU-Net 基线,但未列出具体分割指标数值,因此不同区域(肿块、钙化、腋窝所见、乳腺组织)之间的表现差异尚不清楚。

来源