跳到主要内容
返回时间线
arXiv来源发表:

AbSteering 用异常中心思维链与 DPO 引导通用视频语言模型生成 HRCT 报告,在细粒度临床指标上超越大规模 CT 专用基础模型并提升检出敏感度、减少幻觉。

核心概要

该工作提出 AbSteering 框架,通过异常中心思维链训练与基于直接偏好优化的细粒度异常判别两阶段方法,将通用视频语言模型适配到高分辨率 CT 报告生成,并构建 CT-RATE-AB 数据集;结果显示通用视频语言模型在有限数据下可有效迁移到三维医学影像,在细粒度临床效能指标上达到当前最优,检出敏感度优于用大规模 CT 预训练的领域专用 CT 基础模型,同时减少幻觉。

Source-provided article image: Unleashing Video Language Models for Fine-Grained HRCT Report Generation

深度剖析

通用视频语言模型在有限数据下可有效迁移到高容量三维医学影像报告生成,为从头训练模态专用基础模型提供高效替代方案。 此前 CT 报告生成多依赖训练或深度定制模态专用编码器,数据与算力开销大;该工作系统研究通用视频语言模型的跨模态迁移性,将 HRCT 体积视为类视频切片序列。 论文以跨模态迁移性作为三项贡献之一,并在摘要中报告通用视频语言模型在此范式引导下具备强迁移性;具体数据规模与对照设置需查阅原文实验部分。

异常中心思维链训练将视觉到文本任务重构为从异常检测到报告撰写的结构化序列,促使模型显式推理病理发现并学习标准化报告结构。 不同于直接生成报告的做法,该方法先用结构化模板将 CT-RATE 报告规范为(区域:异常)格式,覆盖十个解剖区域,并引入未分类与重复两个辅助类别进行校验。 方法描述明确给出十区域解剖分类体系与 GPT-4o 句子级分配流程,并经人工精修形成 CT-RATE-AB 数据集;定量效果需参考原文实验。

基于直接偏好优化的细粒度异常判别以同一解剖区域内临床易混淆异常作为硬负样本,增强模型对细微病理差异的区分能力并减少幻觉。 该工作将偏好优化引入 CT 报告生成,利用临床易混淆异常构造硬负样本,针对长尾、局部异常识别这一现有方法受限之处。 摘要报告 AbSteering 在细粒度临床效能指标上达到当前最优,检出敏感度优于大规模 CT 预训练的领域专用基础模型,同时减少幻觉;具体指标数值需查阅原文。

构建 CT-RATE-AB 数据集,用于支持医学影像中的思维链训练,并评估高容量胸部 CT 理解的多样性与细粒度异常识别。 该数据集在 CT-RATE 基础上按解剖分类体系重构报告,提供结构化到原始报告的配对,服务于思维链训练与细粒度评估。 论文将数据集列为三项贡献之一,并说明数据与模型权重已公开;数据集规模与评估协议细节需查阅原文。

启示与展望

该工作面向高容量胸部 HRCT 报告生成场景,适用于希望以有限数据将通用视频语言模型适配到三维医学影像解读的研究者与工程团队;其异常中心思维链依赖按十区域解剖分类体系重构的报告模板,偏好优化依赖同一解剖区域内临床易混淆异常构成的硬负样本,因此方法的应用前提是具备可结构化的报告数据与可定义的混淆异常对。公开的数据与模型权重为后续在其它体积模态或其它解剖区域上的迁移研究提供了起点。

所载文本为论文主体,未包含完整实验表格与具体指标数值,因此无法在此核实检出敏感度、幻觉减少幅度与对比基线的确切数字;CT-RATE-AB 的规模、标注一致性以及思维链与偏好优化各自的消融贡献,仍需查阅原文实验部分。此外,通用视频语言模型在其它体积模态、其它解剖区域以及不同报告规范下的迁移表现,是有待后续工作回答的开放问题。

来源