多模态大语言模型用于膀胱镜膀胱肿瘤检测:一项回顾性基准评测
核心概要
该研究回顾性分析了1,754张带标签的公开膀胱镜图像,测试Direct、Book-based与Optimized三种提示词在GPT-5.2、GPT-5、GPT-5-Mini与GPT-5-Nano上的良恶性分类表现,发现GPT-5与GPT-5-Mini在优化提示词下准确率分别达86.7%与89.2%,GPT-5在优化提示词下高置信度分诊在62.0%图像覆盖率下达到98.1%准确率、94.6%特异度与99.1%敏感度,提示工程虽未带来统计显著的性能提升,但改善了置信度校准与分诊表现。
深度剖析
研究把多模态大语言模型直接用于膀胱镜图像的良恶性分类,并报告了GPT-5与GPT-5-Mini在优化提示词下的准确率分别为86.7%与89.2%,特异度分别为94.1%与88.4%,敏感度分别为82.5%与89.2%。 与依赖数据密集型、难以在常规实践中部署的既有AI方法相比,该工作评估的是更小、更高效的架构,把可部署性作为考察维度之一。 基于1,754张带标签公开膀胱镜图像的回顾性分析,报告了准确率、敏感度、特异度与F1 Score等指标。
研究引入基于损失函数的弃权选项进行高置信度分诊,GPT-5在优化提示词下于62.0%图像覆盖率时取得98.1%准确率、94.6%特异度与99.1%敏感度。 在常规分类之外增加了可弃权的分诊设定,把覆盖率与准确率一并报告,为“哪些图像可自动判读”提供了量化描述。 同一回顾性数据集上的分诊评估,明确给出覆盖率62.0%这一前提条件。
研究比较Direct、Book-based与Optimized三种提示词,发现提示工程改善了模型表现,但增益未达统计显著,同时改善了置信度校准与分诊表现。 把提示词设计作为可操作变量纳入评测,并用Brier Score与Expected Calibration Error刻画置信度可靠性,而不仅是分类准确率。 三种提示词类型在四个模型上的对比,校准指标采用Brier Score与Expected Calibration Error。
启示与展望
该研究面向膀胱镜图像的良恶性分类这一设定,使用1,754张带标签公开图像进行回顾性分析,结论适用于提示词与模型组合的基准比较以及可弃权分诊的可行性探索;对希望评估多模态大语言模型能否作为膀胱镜评估基础模型的研究者与临床技术团队,它提供了准确率、校准与分诊覆盖率的具体参照。
提示工程带来的性能提升未达统计显著,其稳健性仍需在更多数据与设置下观察;高置信度分诊的98.1%准确率对应62.0%的图像覆盖率,其余图像如何处理是实际部署中需要继续明确的问题;此外,本次读取为摘要级范围,图表与补充材料中的分层结果(如按成像模态分层)未在文本中展开,这些细节会影响对结论适用范围的判断。
