跳到主要内容
返回时间线
bioRxiv来源发表:

在1520名受试者的四类情绪与精神病性障碍分类中,类别条件(Mondrian)校准把诊断间覆盖率差距从12.3个百分点压到0.4个百分点,代价是平均预测集仅增大0.07个标签

核心概要

该工作在一个涵盖三项研究、14个采集站点、1520名受试者的四类情绪与精神病性障碍分类任务上显示,边际split-conformal校准虽达到0.9000的经验覆盖率(名义0.90),但健康对照覆盖率为0.941、分裂情感性障碍为0.818,类别条件(Mondrian)校准把这一12.3个百分点的差距降至0.4个百分点,平均预测集大小仅增加0.07个标签(不足3%),并使匹配覆盖率下的集合大小可解释为受试者属性,据此把受试者分为自信、边界、模糊与未解决四层,独立结构MRI模型标记为标签模糊的比例沿该分层单调上升(34.1%、57.3%、68.1%、81.8%;p = 8.8e-18)。

AI-generated editorial illustration: Beyond Marginal Coverage: Class-Conditional Conformal Prediction in Multi-Class Psychiatric Neuroimaging

深度剖析

在多类诊断分类中,边际覆盖率可以恰好达标而各诊断类别覆盖极不均衡:健康对照0.941、分裂情感性障碍0.818,盈余与亏缺相互抵消,使总体数字对两者都不具信息量。 把通常被当作充分保证的边际覆盖指标,放到四类情绪与精神病性障碍分类的具体场景中检验,指出该保证在多类不平衡情形下不足以描述单类诊断的可靠性。 基于1520名受试者、三项研究、14个采集站点的四类分类任务,报告边际split-conformal校准的经验覆盖率为0.9000(名义0.90),并给出各类别覆盖率。

类别条件(Mondrian)校准把诊断间覆盖率差距从12.3个百分点降至0.4个百分点,平均预测集大小仅增加0.07个标签,不足3%。 给出一种在几乎不牺牲预测集紧凑性的前提下实现跨诊断覆盖均衡的校准方式,并量化其代价。 报告了校准前后的覆盖率差距(12.3个百分点对0.4个百分点)与平均集合大小增量(0.07个标签,低于3%)。

在覆盖率跨诊断固定后,集合大小的残余变异不再能归因于类别先验或单类准确率,而可解释为受试者属性;据此得到的预测集把受试者分为自信、边界、模糊与未解决四层,独立结构MRI模型标记为标签模糊的比例沿该分层单调上升(34.1%、57.3%、68.1%、81.8%;p = 8.8e-18)。 把集合大小从模型性能的副产品重新定位为个体层面的可解释信号,并用一个在同一队列上单独训练的结构MRI模型提供外部一致性证据。 分层比例呈单调上升并给出p = 8.8e-18;同时报告无分裂情感性障碍受试者、0.9%的双相障碍受试者进入自信层,而健康对照为18.0%、精神分裂症为13.4%。

在匹配覆盖率下,集合大小提供了准确率无法给出的表征比较:结构MRI、功能MRI及其融合之间出现符号反转——融合使双相障碍(-0.25)与分裂情感性障碍(-0.23)受试者的集合变小,却使健康对照变大(+0.16),而总体融合收益在alpha = 0.10以下改变符号,同时top-1准确率沿三个模型单调上升(0.495、0.578、0.611)。 展示集合大小这一指标能揭示被准确率掩盖的类别异质性效应,并指出总体融合收益对显著性水平的敏感性。 报告了三个模型上的top-1准确率(0.495、0.578、0.611)以及融合对各类别集合大小的变化量(-0.25、-0.23、+0.16),并说明总体融合收益在alpha = 0.10以下改变符号。

启示与展望

该结果面向多类且类别不平衡的诊断分类场景,尤其是精神科神经影像中的情绪与精神病性障碍四分类;对希望把共形预测用于临床决策支持的研究者与开发者,它说明在报告边际覆盖之外还应报告类别条件覆盖,并可在匹配覆盖率下用集合大小比较结构MRI、功能MRI与融合等表征。受试者分层(自信、边界、模糊、未解决)与独立结构MRI标签模糊标记的一致性,为在个体层面解读预测集提供了可继续检验的方向。

当前可见文本为摘要,未包含图表、各站点或各研究的分层结果、校准细节与统计检验的完整设定;因此类别条件校准在不同站点间的稳定性、集合大小分层与结构MRI标签模糊标记之间关系的具体机制,以及融合收益符号随alpha变化的行为,仍是需要结合全文进一步确认的开放问题。

来源