跳到主要内容
返回时间线
arXiv来源发表:

K-MaT 用最优传输对齐提示流形,在无低端训练图像条件下把医学视觉语言模型迁移到低端模态

核心概要

K-MaT 是一个提示学习框架,通过分解提示、将其锚定到临床文本描述,并用 Fused Gromov-Wasserstein 最优传输把低端提示流形对齐到视觉接地的 高端空间,从而在不需要低端训练图像的情况下把决策结构迁移到低端模态;在四个跨模态基准(含皮肤镜、乳腺摄影到超声、CT 到胸片)上取得最优结果,平均准确率调和均值从 BiomedCoOp 的 42.0% 提升到 44.1%,宏 F1 达 36.2%,并在乳腺成像任务上缓解了 CoOp 在低端跌至 27.0% 准确率的灾难性遗忘。

AI-generated editorial illustration: K-MaT: Knowledge-Anchored Manifold Transport for Cross-Modal Prompt Learning in Medical Imaging

深度剖析

提出 K-MaT 提示学习框架,可在没有低端模态训练图像的情况下把决策结构迁移到低端模态,针对的是大型生物医学视觉语言模型在高 端成像(如 CT)上适配后难以迁移到前线低端模态(如 X 线摄影)并退化为模态特定捷径的问题。 与依赖低端训练图像的常规适配不同,K-MaT 通过提示分解、临床文本锚定以及 Fused Gromov-Wasserstein 最优传输对齐提示流形,实现零样本跨模态部署。 摘要报告在四个跨模态基准上评估,包括皮肤镜、乳腺摄影到超声、CT 到胸片,并给出与 BiomedCoOp 和 CoOp 的对比数值。

在四个跨模态基准上取得最优结果,平均准确率调和均值达到 44.1%,高于 BiomedCoOp 的 42.0%,宏 F1 为 36.2%。 给出了跨模态迁移场景下可比较的量化提升,而不仅是单模态适配表现。 摘要给出具体指标数值与对比基线,但未在可见文本中提供逐基准分解或统计检验细节。

在具有挑战性的乳腺成像任务上缓解了标准方法(如 CoOp)出现的灾难性遗忘,CoOp 在低端跌至 27.0% 准确率,而 K-MaT 保持跨模态的稳健表现。 把稳健性作为跨模态迁移的核心指标之一,而不只关注平均精度。 摘要以 CoOp 低端 27.0% 准确率作为对照,说明 K-MaT 在该任务上避免了同等退化。

启示与展望

该工作面向的是把在高 端成像上适配的医学视觉语言模型迁移到低端模态的零样本部署场景,适用于缺乏低端训练图像的前线影像环境;其方法依赖临床文本描述作为锚点,并以 Fused Gromov-Wasserstein 最优传输对齐提示流形。评估覆盖四个跨模态基准,包括皮肤镜、乳腺摄影到超声、CT 到胸片。

可见文本仅为摘要与页面导航,缺少逐基准结果表、消融实验、统计显著性以及低端模态覆盖范围的细节,因此 44.1% 与 36.2% 等指标在不同任务上的分布、以及乳腺成像上稳健表现的边界条件,仍是读者需要进一步查看正文才能确认的开放问题。

来源