分割一切模型中的提示工程:方法、应用与新兴挑战
核心概要
这篇综述系统梳理了SAM及其衍生模型中的提示工程研究,提出将提示方法分为几何提示、文本语义提示与多模态融合提示的三层分类体系,并进一步归纳从人工标注到基于检测器、原型学习、强化学习与视觉语言模型的自动化提示生成路径,同时追踪提示工程在医学影像、遥感、工业检测与异常检测等领域的跨域泛化应用,指出提示敏感性、跨模态错位与计算低效等关键挑战,并提出因果提示推理、多智能体协同提示与基于扩散的渐进式细化等未来方向。
Figure 1: Taxonomy of prompt types and generation methods.
· 第 4 页深度剖析
提出面向功能的提示工程三层分类体系,将SAM相关方法划分为几何提示、文本语义提示与多模态融合提示。 既有SAM综述多聚焦架构与下游性能,或仅覆盖单一提示类型(如点提示),本文以“分割什么”与“在哪里分割”这一功能问题为分类逻辑,给出跨策略的统一分类。 综述性工作,分类依据为对2023年4月SAM发布至2025年12月间文献的系统检索与归纳,检索来源包括Google Scholar、Semantic Scholar、arXiv、IEEE Xplore与ACM Digital Library。
刻画了几何提示从人工输入与启发式增强、检测器自动生成、图像特征自提示到优化驱动生成的四种递进范式。 将分散的自动化提示方法按生成规则性质与推理机制复杂度组织为递进谱系,并给出各范式在提示规则、核心驱动、推理阶段交互方式上的对比。 基于对代表性方法的归纳与对比表,涵盖启发式(如SAMAUG、RoBox-SAM)、检测器(如YOLO-SAM 2、AM-SAM)、自提示(如APSeg、Label Anything)与优化驱动(如TEPO、SAMRefiner)等具体方法。
梳理文本语义提示的两条技术路线:语义粒度驱动的提示构建与文本到几何提示生成。 区分“深层语义注入”与“显式代理坐标转换”两种语义消费方式,并指出前者侧重嵌入对齐、后者侧重与SAM原生几何接口的兼容性。 综述性归纳,涉及类别级与部件级提示(如Talk2SAM、SP-SAM)、结构化知识驱动(如PG-SAM、TP-DRSeg)与CLIP对齐管线(如CLISC、GenSAM)等具体方法。
总结提示工程在医学影像、遥感与工业异常检测中的领域适配逻辑与量化基准表现。 将跨域应用按任务驱动范式组织(如医学中的解剖、病理与临床自适应学习),并汇总各方法在Dice、NSD、HD95、F1、AUROC等指标上的报告结果。 综述性汇总,量化结果来自各被引方法在其自选基准上的报告,文中亦指出不同论文指标选择差异使直接数值比较存在困难。
启示与展望
本综述的适用范围为2023年4月SAM发布至2025年12月间公开的、以提示驱动分割的方法,主要纳入利用提示引导与定制分割结果的工作,排除缺乏提示交互的任务专用模型;其分类与对比面向希望理解提示工程在分割基础模型中角色的研究者与工程实践者,尤其适用于医学影像、遥感与工业检测等专业领域的适配设计参考。
作为综述,其量化对比依赖各被引方法在自选基准上的报告,指标选择差异使跨论文数值比较存在困难;提示如何调制SAM内部注意力并最终影响掩码生成路径,文中指出仍缺乏系统性建模;因果提示推理、多智能体协同提示与扩散式渐进细化等方向目前多为展望,其可行性与效果有待后续验证。
