KAIST团队用提示模板分歧生成偏好监督,在MESS基准上让开放词汇分割无需像素级标注即获一致提升
核心概要
该工作提出偏好引导的开放词汇语义分割适配框架,把不同提示模板对同一图像产生的分割差异(提示分歧)转化为二元偏好监督,用区域局部化偏好优化(RLPO)加一致性正则化在流式单步设定下适配模型,在MESS基准的五个领域组上对SAN与CAT-Seg两种骨干(ViT-B/16与ViT-L/14)均取得一致提升且无需像素级标注,并在偏好噪声下保持有效。
深度剖析
作者观察到不同提示模板会对同一图像和同一类名产生系统性不同的分割结果,称之为提示分歧,并将其重新用作内置的偏好监督来源。 此前视觉偏好学习依赖随机采样、输入扰动或输出采样等辅助机制制造候选多样性,而这里直接利用提示接口本身已有的变化,不引入额外机制或超参数。 论文报告在多个专业领域上,同一骨干的验证mIoU在不同模板间差异明显;消融中提示分歧的集成平均mIoU为45.88,高于MC Dropout的39.09与测试时增强的44.66(候选规模匹配)。
提出区域局部化偏好优化(RLPO):用跨提示熵定位高不确定区域,在该区域内选出分歧最大的模板对,把二元偏好施加到像素级分割分数上,从而由一次比较获得密集空间监督。 标准DPO面向语言生成,此前的分割偏好工作多限于固定目标或小闭集标签空间;该工作把DPO的Bradley–Terry目标特化到模板条件分割,并采用按类均衡的区域分数以避免大类别主导。 在CAT-Seg-L上,去掉RLPO后平均mIoU从45.88降至40.51,去掉一致性正则化后降至43.45,说明RLPO是适配的主要驱动。
引入一致性正则化,用被偏好预测作为被拒预测在查询区域之外的伪目标,抑制偏好优化在未查询区域造成的意外漂移。 偏好损失只监督被选中的区域,该正则化补上了区域外缺乏约束这一环节,使单步流式更新更稳定。 消融显示去掉一致性正则化后平均mIoU为43.45,低于完整方法的45.88,且各领域组均低于完整方法。
在MESS基准五个领域组上,该方法在无像素级标注条件下对四种骨干配置均取得一致提升,并在偏好噪声下保持有效。 相比零样本基线,SAN-B、CAT-Seg-B、SAN-L、CAT-Seg-L的平均mIoU分别提升约7.10、6.55、6.59、10.62;在医学与工程等领域甚至超过同预算的密集掩码参考。 结果在三种随机种子下取平均;噪声实验中标签以概率翻转时增益基本不变,即使噪声较重仍能恢复约若干mIoU;附录D报告人类与预言机在600次判断上总体一致率为0.920。
启示与展望
该框架面向目标词汇能用自然语言提示合理表达、且提示诱导的候选中至少有一个在查询区域内可用的专业领域适配场景;适配采用流式单步设定,每张图像产生一次二元偏好并做一次梯度更新,不重复访问图像。它适用于希望以极低标注成本(每图一次二元判断)把开放词汇分割模型迁移到医学、遥感、工业检测、农业等领域的实践者,并已在MESS基准的五个领域组与SAN、CAT-Seg两类骨干上验证。
当所有模板在查询区域内都给出相近且不准确的预测时,偏好信号的信息量会下降,选择“较不错误”的候选对正确分割的引导有限,这在术语、外观或标签粒度难以被自然图像风格模板覆盖的高度专业概念上更可能出现;作者提出引入学习型、领域专用或专家提供的模板作为后续方向。此外,主实验的偏好由与真值比较的预言机提供,附录D以600次人类判断验证其一致性(总体0.920,困难对为0.840),真实标注者的行为分布仍是值得继续观察的问题。本次读取为全文,但图表以文本形式呈现,个别数值的精确读法以原文表格为准。
