跳到主要内容
返回时间线
arXiv来源发表:

在90万张CT/MRI切片上训练的稀疏自编码器把医学影像基础模型的稠密嵌入拆成可语言描述的概念,10个特征即恢复87.8%下游性能

核心概要

该研究在TotalSegmentator数据集的909,873张CT与MRI二维切片上,对冻结的BiomedParse(生物医学)与DINOv3(通用)基础模型嵌入训练Matryoshka稀疏自编码器(BatchTopK稀疏化),并设随机权重基线,发现稀疏特征能以最高R2=0.941重建原始嵌入、仅用10个特征即恢复87.8%下游性能(99.4%降维)、以5特征指纹保留97.7%稠密检索质量、经独立大模型评判对应可语言表达的单义概念,并在单条临床文本查询上实现零样本语言驱动图像检索。

Source-provided article image: Sparse Autoencoders for Interpretable Medical Image Representation Learning

深度剖析

稀疏自编码器能在保持语义效用的前提下把稠密医学影像嵌入压缩为极少量可解释特征:BiomedParse最优配置以10个特征恢复87.8%稠密ROC-AUC,DINOv3恢复82.4%,且N=10以上收益递减。 此前将稀疏自编码器用于影像嵌入的证据来自胸片单一模态、单一架构且依赖配对文本监督;本工作把该证据扩展到CT与MRI两种模态、两种架构不同的基础模型,并覆盖多解剖区域。 在96种配置/模型上系统扫描,测试集为三家机构完全留出的14.1%图像;稠密基线ROC-AUC为0.907(BiomedParse)与0.912(DINOv3)。

重建保真度不等于语义效用:随机权重BiomedParse基线在相近R2区间(0.587–0.915)下ROC-AUC仅0.606–0.651,而DINOv3的R2较低(0.649–0.841)却取得更高下游AUC。 该解离把“重建得好”与“编码了有意义的表征结构”区分开,说明稀疏编码可以忠实重建一个无语义结构的随机嵌入空间。 由随机权重基线这一对照条件直接支持,与两个已训练模型在同一评估流程下比较。

稀疏特征对应可被语言表达的单义概念,且无需显式解剖标签即从自监督训练中涌现:独立VLM评判中DINOv3有170/250个特征描述被排为第1(平均排名1.60),BiomedParse为141/250(平均排名1.91)。 概念描述由VLM从激活图像与元数据自动生成、再由另一个独立VLM在五个候选(1真4干扰)中判别,而非依赖人工标注或配对文本监督。 每模型评估250个最单义特征,采用LLM-as-judge排名;单义性评分本身基于元数据器官标签与VLM生成描述,属代理性证据。

稀疏特征概念可充当临床语言与抽象潜表征之间的桥梁:对查询“Axial CT of the abdomen and retroperitoneum in an elderly patient”,DINOv3选出三个解剖与模态特异的腹部CT概念并检索到正确的轴位腹部CT,而BiomedParse缺少模态纯净的腹部特征、选出混合MRI/CT概念并检索到胸部图像。 这是零样本、无需参考图像或任务特定训练的语言驱动检索演示,把自动标注的稀疏特征用于文本到医学图像的匹配。 为单条查询的概念验证演示,作者明确指出跨更广查询集的聚合评估留待未来工作。

启示与展望

该结果面向希望在不改动架构、不重训练、不用任务特定标签的前提下检查冻结医学影像基础模型内部的研究者与工程团队,适用于CT与MRI二维切片、正常解剖、跨10家机构的数据设定。它使后续工作可以在此基础上做概念级检索、特征级审计与语言接口设计,并把此前胸片上的稀疏自编码器证据推广到多模态容积成像与两种架构不同的基础模型。

单义性评分依赖元数据推导的器官标签与VLM生成的概念描述,而非人工标注,属可扩展但代理性的证据;TotalSegmentator覆盖正常解剖、两种模态,不含病理病例,分析在二维切片层面而非容积层面;语言驱动检索仅在单条查询上演示,跨更广查询集的聚合评估仍待未来工作;人口学等更细粒度约束仍是开放方向。此外,本文为快速解析文本,图2、图3、图4的具体图像内容与部分表格细节无法从文本完全还原,若需核对配置曲线与检索示例需查阅原文图表。

来源