跳到主要内容
返回时间线
arXiv来源发表:

MedQ-Engine 用 10K 标注把 8B 医学图像质量评估模型提升到超过 GPT-4o 逾 13%,与人类专家差距缩至 4.34%

核心概要

该工作提出 MedQ-Engine 闭环数据引擎,通过“评估—探索—进化”三阶段迭代:在开发集上把模型失败案例聚类为失败原型,用原型视觉分量在约百万张、覆盖五种模态的医学图像池中检索候选样本,配合熵引导路由的渐进式人在回路标注与质量保障微调,仅用 10K 标注即让 8B 参数模型在医学图像质量评估上超过 GPT-4o 逾 13%、与人类专家差距缩小到 4.34%,样本效率比随机采样高 4 倍以上。

Source-provided article image: MedQ-Engine: A Closed-Loop Data Engine for Evolving MLLMs in Medical Image Quality Assessment
Fig. 1

Fig. 1. Overview of MedQ-Engine. Our closed-loop data engine iteratively im- proves MLLMs for Med-IQA via three phases: Evaluating (failure clustering on a dev set), Exploring (prototype-based retrieval and human-in-the-loop annotation), and Evolving (quality-assured fine-tuning with re-evaluation).

· 第 2 页

深度剖析

提出面向医学图像质量评估的闭环数据引擎,把数据驱动的错误分析转化为系统性的模型改进。 此前方法或只输出与模态无关的标量分数,或局限于单一模态;该工作首次将“评估—探索—进化”迭代循环用于 Med-IQA,使数据收集随模型弱点演化而调整。 论文在五种医学影像模态上开展实验与消融,并给出闭环三阶段的完整流程描述与图示。

用数据驱动的失败发现机制替代预定义错误类别:在独立开发集上多次评估模型,将错误率超过阈值 γ 的样本判为失败案例,再用凝聚聚类与轮廓系数确定簇数,得到失败原型。 失败模式直接从模型行为中刻画,而非人为设定错误分类;原型仅取视觉分量作为检索锚点,用于查询无标注图像池。 方法部分给出失败判定阈值、聚类准则与检索相似度阈值 τ_sim 的形式化定义;消融显示移除全部引擎组件(随机基线)性能下降 9.46%。

渐进式人在回路标注与熵引导路由显著降低专家成本:冷启动阶段 GPT-4o 预标注 2K 样本并由专家逐条审核,后续迭代按轨迹级熵等信号分流,人类复核率降至 18%。 相比全量人工审核,冷启动时 GPT-4o 的 63% 接受率把单样本审核时间从 5.1 分钟降到 0.5 分钟,整体专家成本降低 5 倍以上。 论文给出标注统计表,列出接受率 63%、编辑率 29%、拒绝率 8%、平均审核时间 0.5 分钟与 5.1 分钟等具体数值。

数据缩放分析显示失败驱动采样在困难场景收益最大:基础模型在无退化图像上表现良好,但在轻度和重度退化上准确率下降超过 30%,MedQ-Engine 在轻度与重度案例上改进最大;训练后模态特定问题持续优于通用问题。 说明失败驱动数据收集确实瞄准了最具挑战性的场景,且领域特定训练数据有助于模型形成对模态特征性退化的专门知识。 基于两种模型架构(InternVL3-8B、Qwen2.5-VL-7B)在 2K 至 40K 数据规模上的缩放曲线,以及失败驱动与随机采样的对比。

启示与展望

该结果面向医学图像质量评估这一具体任务,适用于需要描述性质量评估与临床推理、且专家标注稀缺的医学影像场景;作者认为其“评估—探索—进化”范式可推广到其他专家标注稀缺、模型弱点非均匀的专门领域。方法依赖一个约百万张、覆盖五种模态的图像池,以及可用的开发集与人工审核环节,因此其收益在具备类似数据池与专家资源的团队中更易复现。

原文为快速解析版本,正文中的部分表格与公式在文本中不完整,例如熵引导路由的三条路径细节、轨迹级熵公式的完整形式以及部分消融表格内容未能完整呈现,因此这些环节的具体设定仍需查阅原文图表确认。此外,失败原型数量、相似度阈值与自适应采样权重的具体取值未在文本中给出,读者若要复现需核对原文。结果基于论文自建的开发集与评测基准,其在其他机构数据分布上的表现属于尚待观察的开放问题。

来源