AI模型按BITSS七分类判读婴儿粪便仅0.56准确率,合并为四类后升至0.76
核心概要
该研究用1312张婴儿尿布粪便照片(经质量筛选后1100张,其中896张获三位儿科胃肠病学家多数一致作为参考集),基于Teachable Machine卷积神经网络训练20个模型(85/15训练与内部验证划分),评估AI与专家按BITSS分类的一致性:七分类最佳模型总体准确率0.56,线性与二次加权Kappa分别为0.59和0.75;合并为便秘、成形、软便、液体四类后准确率升至0.76,加权Kappa为0.69和0.78,而三位专家之间Fleiss Kappa仅0.24、完全一致率24.7%。
深度剖析
在拉丁美洲背景下,AI模型对婴儿尿布粪便的BITSS分类与儿科胃肠病学家参考分类达到中等至较高一致性,七分类二次加权Kappa为0.75,四分类为0.78。 此前相关图像识别研究多来自其他地区,本文提供了本地数据上的内部验证证据,并同时报告了专家间一致性与AI-参考一致性两套指标。 基于896张获多数一致的图像、20个独立模型(七分类与四分类各10个)以及线性/二次加权Kappa及95%置信区间,属内部验证而非外部验证。
将BITSS七类合并为四类功能分组后模型表现明显提升,总体准确率由0.56升至0.76,说明减少类别数有助于算法区分与稳定。 研究直接对比同一图像库上七分类与四分类两种设定,量化了类别粒度对AI表现的影响。 来自同一参考集上模型7与模型19的混淆矩阵及分类别敏感度、特异度、精确率与F1分数,四分类中便秘组F1最高(0.90),成形便组最低(0.45)。
专家之间对BITSS的判读本身存在明显变异,三位专家完全一致率仅24.7%,Fleiss Kappa为0.24,分歧多集中在相邻类别,尤其BITSS 3与4。 该结果把AI表现放在人类判读基线之上理解,提示分类困难部分来自量表本身的中间类别模糊性,而非仅由算法造成。 基于三位儿科胃肠病学家独立盲法判读、多数票确定参考类别,并报告成对加权Kappa(线性0.43-0.55,二次0.63-0.76)。
模型错误主要集中于相邻类别,BITSS 4(成形便)在七分类与四分类中均为判别力最差的类别。 这一模式与医学图像序数分类中误差聚集于相邻类别的既有观察一致,并提示类别样本不均衡可能影响表现。 来自混淆矩阵与分类别指标:七分类中BITSS 4敏感度0.11、F1为0.20;四分类中成形便组敏感度0.39、F1为0.45。
启示与展望
该研究面向12个月以下婴儿尿布中粪便照片的自动分类,适用于具备标准化拍摄条件(分辨率不低于640×480像素、光照均匀、粪便可见面积超过50%)的场景,可作为儿科胃肠病学中减少视觉判读变异的研究性工具。其价值在于为后续外部验证研究提供内部验证与初步可重复性证据,并提示在类别粒度较粗(四类功能分组)时算法更稳定,适合用于筛查或辅助分组的探索性应用。
作者指出Teachable Machine平台限制了对模型技术细节的访问,影响训练过程的完整复现;图像数据库无法按患者确定独立性或每位婴儿的单独贡献;排除无共识图像并施加最低图像质量标准,可能使数据集代表性低于典型临床场景。此外,类别样本不均衡可能使表现偏向样本最多的类别,未来版本需增加少见类别的代表性。读者仍可关注:在完全一致子集上模型是否稳定、不同诊断确定性水平下的表现,以及外部验证能否复现四分类下的较高一致性。
