跳到主要内容
返回时间线
arXiv来源发表:

Fact-Flow 用 LLM 自动生成多标签事实引导,使 MLLM 医学报告在结核与眼科数据上事实准确性提升

核心概要

该工作提出 Fact-Flow 框架,将视觉事实识别与报告生成解耦:先用 LLM 自动从训练报告中抽取并合并临床发现标签体系(结核 7 个标签、眼科 42 个标签),再训练多标签分类器预测发现,最后把预测标签序列化为提示引导 MLLM 生成报告;在结核胸片数据集上 MedGemma + Fact-Flow 取得 RadFact F1 0.3055(对比 MedGemma 单独 0.2266),在眼科数据集上 Qwen2.5-VL + Fact-Flow 在多数 NLG 指标上最优。

Source-provided article image: LLM-Bootstrapped Targeted Finding Guidance for Factual MLLM-Based Medical Report Generation
Fig. 1

Fig. 1. The overall framework of Fact-Flow

· 第 3 页

深度剖析

提出 Fact-Flow,通过显式多标签临床发现条件化来改进 MLLM 医学报告生成,把图像到报告的端到端映射改为经中间多标签表示 Y∈{0,1}^k 的两步流程。 与直接基于图像特征生成报告的做法不同,该框架先预测临床发现再据此生成报告,使报告有明确的事实依据。 在结核与眼科两个数据集、三种 MLLM(Qwen2.5-VL 7B、MedGemma 4B、LLaVA-Med-v1.5-Mistral 7B)上均报告了一致改进;结核数据集上 MedGemma + FF 的 RadFact F1 为 0.3055,高于 MedGemma 的 0.2266。

设计全自动、LLM 引导的数据流水线,从已有图像-报告对构建大规模(图像,多标签)数据集,无需人工标注。 此前标签引导方法如 TieNet 假设与特定数据集紧绑的固定词表,而该流水线通过分批抽取加迭代层次合并自动生成统一标签体系,并可用频率阈值过滤。 使用 GPT-5-mini,b=200、κ=200、θ=15,得到结核 7 个标签、眼科 42 个标签;在眼科数据集 50 份随机抽样报告上,由专业眼科医生核验,覆盖率与 LLM-Match 准确率均为 100%(50/50),标签冗余度 7.5%,80% 标签为有效且可判定,无无效标签。

在多标签分类阶段引入适配到多标签二分类的 logit adjustment,以应对医学数据中罕见但关键发现占比不足 1% 的长尾问题。 标准二元交叉熵倾向忽略尾部类别,该方法按经验标签频率的 log-odds 平移每个原始 logit(τ=1)后再计算损失,重新平衡决策边界。 引导模型在测试集上取得结核 Macro-/Micro-F1 0.5227/0.7328、眼科 0.7071/0.8426,作者据此认为其提供了足够的事实基础。

通过消融分析说明视觉信息与事实引导互补,并指出标签质量是主要瓶颈。 在结核数据集上用 Qwen2.5-VL 比较五种配置,显示仅图像时出现模式崩溃(精确率 1.0000、召回率 0.0145),加入预测标签后 F1 升至 0.2115,图像加预测标签达到最佳实用表现 F1 0.2831;而使用真实标签的 oracle 配置(图像+标签 GT)F1 达 0.4421,高于仅标签 GT 的 0.3750。 该结论来自同一数据集上的受控配置对比,包含预测标签与真实标签两种来源以及图像有无两种输入组合。

启示与展望

该框架面向报告围绕目标化、可枚举发现类别的临床场景,作者明确将其定位为即插即用、兼容任意 MLLM 架构。它适用于已有图像-报告对、但缺少细粒度发现标签的疾病聚焦数据集,可减少人工标注需求。就读者而言,这意味着在结核胸片与眼科多模态(眼底、OCT、OCTA)这类场景中,可先构建标签体系与多标签分类器,再以标签提示引导生成。

眼科数据集目前没有公认的临床效能指标,因此该数据集仅报告 NLG 指标,其临床事实正确性尚待专门评估。预测标签与真实标签条件之间的性能差距提示标签质量是关键瓶颈,标签体系与分类器的改进空间值得关注。此外,结核数据集规模较小,零样本闭源模型表现不佳这一观察也提示域内训练的必要性;这些结果是否可推广到其他病种、其他语言报告与更大规模数据,仍是开放问题。

来源