FAR-POLYP-SEG:带患者级元数据的前瞻性单中心结肠镜息肉分割数据集与跨数据集基线评估
核心概要
该研究在伊朗德黑兰Farhikhtegan医院于2025年2月至12月常规结肠镜检查中前瞻性采集了来自455名患者的8181帧图像(432帧息肉阳性并带专家像素级分割掩膜、7749帧正常黏膜),为每例关联年龄、性别、检查指征、BBPS评分和操作时长等患者级元数据,并在统一协议下用患者分组五折交叉验证训练评估六种分割架构,发现PraNet内部Dice最高(0.755)、nnU-Net内部IoU最高(0.665)且像素准确率最高,但正常黏膜上的门控假阳性率从24.9%(YOLOv11m-seg)到59.5%(nnU-Net)几乎完全反转了内部Dice排序,而在公开Kvasir-SEG外部测试集上D
深度剖析
构建并公开了一个前瞻性单中心结肠镜息肉分割数据集,包含8181帧来自455名患者的图像,其中432帧息肉阳性帧配有专家像素级分割掩膜,7749帧为正常黏膜帧,并为每例关联年龄、性别、结肠镜指征、BBPS评分和操作时长等患者级临床与操作元数据。 相较许多公开结肠镜数据集规模有限、省略正常黏膜帧或缺少关联的患者级临床背景,该数据集同时提供息肉阳性掩膜、大量正常黏膜帧和结构化患者级元数据,可作为影像信息学基准资源。 前瞻性采集于2025年2月至12月常规结肠镜检查,未改变标准诊断流程;帧数与患者数、掩膜与元数据构成在文中明确给出。
在统一标准化协议下用患者分组五折交叉验证训练并评估六种分割架构(UNet、UNet++、UNet (MiT-B0)、nnU-Net 2D、PraNet、YOLOv11m-seg),确保任一折中同一患者的帧不会同时进入训练集与测试集。 以患者分组交叉验证和统一协议对多种架构进行内部比较,减少了同一患者帧跨训练与测试带来的评估偏差,为数据集提供了可复现的基线。 六种架构、统一协议与患者分组五折交叉验证在文中明确描述,并报告了内部Dice与IoU等指标。
内部评估中PraNet取得最高Dice(0.755),nnU-Net取得最高IoU(0.665)和最高像素准确率;但在7749帧正常黏膜上的门控假阳性率从24.9%(YOLOv11m-seg)到59.5%(nnU-Net),几乎完全反转了内部Dice排序,说明对真实息肉最敏感的模型并非最具特异性。 通过在同一数据集上补充正常黏膜帧的特异性评估,揭示了仅凭内部Dice排序可能掩盖模型在正常黏膜上的假阳性差异,为分割算法的验证提供了敏感性与特异性分离的视角。 内部Dice、IoU、像素准确率与正常黏膜门控假阳性率均以具体数值报告,正常黏膜帧数为7749。
所有模型在公开Kvasir-SEG数据集作为未见外部测试集上评估,Dice为0.756至0.829,相对排序大体保持,但nnU-Net在准确率和IoU上的内部优势未延续到外部Dice。 提供了跨数据集的基线评估,显示内部性能排序在外部数据上大体可迁移,但个别模型在特定指标上的内部优势不一定外推。 外部评估在公开Kvasir-SEG上进行,报告了各模型Dice范围0.756至0.829及排序保持情况。
启示与展望
该数据集面向结肠镜息肉分割算法的验证与影像信息学研究,适用于在单中心常规结肠镜检查场景下开展内部基准比较和跨数据集评估;公开的数据集、结构化元数据与评估代码可供研究者复现基线并在此基础上扩展。
该工作为单中心前瞻性数据集,外部评估仅使用Kvasir-SEG,跨中心、跨人群与跨设备的泛化表现仍是开放问题;正常黏膜假阳性率与内部Dice排序反转的现象在不同数据分布下是否稳定,以及患者级元数据在算法开发中的具体增益,均有待进一步研究。
