FoMo 用扩散轨迹的分叉时刻自动生成感知距离标签,在 PIPAL 上以 0.733 的 SROCC 超过人工标注数据训练的同架构指标
核心概要
该工作提出 FoMo:把参考图前向加噪到某个采样时间步后再独立去噪,用这个“分叉时刻”作为点对点感知距离标签,无需任何人工标注即可生成训练数据,并用 RankNet 式全局排序目标训练参考型图像质量评估指标;在 PIPAL、TID2013、CSIQ、LIVE 四个基准和七种骨干上取得最佳平均表现,其中 PIPAL 上 LPIPS-Alex 达到 0.733 的 SROCC,高于使用人工标注数据(如 KADID-10k 的 0.577)的同架构结果。
深度剖析
提出一条全自动、无人工标注的数据生成流程:给定参考图,按噪声调度采样一个分叉步,构造加噪隐变量后继续去噪得到变体,分叉步本身即作为该图像对的感知距离标签。 此前参考型 IQA 依赖 MOS 点值评分或 2AFC 成对偏好标注;MOS 采集昂贵且噪声大(文中提到 KADID-10k 需 30 份众包评分、2,200 余名被试),2AFC 只给出相对比较。FoMo 用扩散生成动力学替代人工标注,直接产出支持任意图像对比较的点值标签。 论文报告训练集共 480k 对标签,其中 240k 以 ImageNet 真实图为参考、240k 以 FLUX 生成图为参考;附录给出同一参考同一分叉步重复生成的标签方差分析(120 张 ImageNet 参考、5 个分叉步、共 4,800 张图),标准差绝对值较小、变异系数最高约 10%。
通过两项人类实验验证分叉时刻与人类感知排序一致:单参考排序研究中,30 名被试、190 张 ImageNet 验证集参考图、1,982 条回答,分叉时刻排序与人类判断的 Spearman 相关为 0.970(评分者间相关 0.960);跨参考 2AFC 研究中,28 名被试、250 个条目、5,713 条回答,个体回答与标签一致,Fleiss 一致性显示近乎完美,多数票共识在时间步间隔超过 20 步后全部与标签一致。 把“扩散轨迹早期定粗结构、后期定细节”这一既有观察,转化为可验证的感知距离代理,并给出跨参考的全局一致性证据,而不仅是单一参考内部的单调性。 两项研究均为受控人类实验并报告了被试数、条目数与一致性统计;此外用 LPIPS-Alex、LPIPS-VGG、DISTS、DreamSim 四个已拟合人类判断的指标在 20,000 对生成数据上做规模化替代验证,SROCC 分别为 0.932、0.915、0.904、0.904,间隔超过 20 步时一致率超过 99.4%。
点值标签使训练目标从三元组成对比较升级为批内全局排序:构造真值比较矩阵并用 RankNet 式二元交叉熵监督所有对之间的顺序。 2AFC 数据只能做三元组二分类,训练中看不到全局排序;FoMo 的点值标签支持全局排序目标,消融显示 RankBCE 一致优于 2AFC 式成对 BCE 和 L1 回归,且在该目标下 FoMo 仍是更好的训练来源。 消融在 PIPAL 上以 LPIPS-Alex 与 DINOv3 为代表:LPIPS-Alex 上 Rank 为 0.733、2AFC 为 0.592、L1 为 0.440;DINOv3 上 Rank 为 0.699、2AFC 为 0.622、L1 为 0.694。批量大小分析显示 Transformer 骨干随批量增大持续提升,CNN 骨干在批量 64 处达到峰值。
跨生成器与跨骨干的泛化验证:用 SD-1.5、SD-XL、SD3、FLUX.1 分别生成数据,在 10k 对的缩减预算下每个生成器都能训出可用指标,FLUX.1 在两个骨干上均为最强;时间步范围消融显示 50 步流程中前 35 步最重要。 说明方法不绑定于单一扩散模型,同时表明生成器质量会影响结果,为后续在不同领域自训练扩散模型以扩展数据提供了路径。 跨生成器实验每个生成器 50k 对池中抽取五个互不重叠的 10k 子集、固定训练种子;LPIPS-Alex 上 SD-1.5 为 0.687、SD-XL 为 0.662、SD3 为 0.695、FLUX.1 为 0.741,DINOv3 上分别为 0.574、0.418、0.517、0.672。
启示与展望
该结果面向参考型图像质量评估,适用于超分辨率、去噪等需要计算复原图与参考图之间距离的复原任务,以及需要跨图像对全局排序的评测场景。方法在设定上要求能访问一个扩散模型来生成训练数据,论文展示的默认配置是 FLUX.1-dev、最多 50 个采样步、分叉步在 1 到 50 之间均匀采样、共 480k 对训练数据,训练在单张 NVIDIA RTX A40 上约 240k 次迭代。受益者包括需要大规模感知标签但缺乏标注预算的 IQA 研究者与图像复原、压缩、生成评测流程的构建者。论文还指出一条扩展路径:当目标领域与训练分布不同时,可在该领域上训练扩散模型并用它生成新样本,从而把同一流程迁移到新领域。
需要留意的是,标签来自扩散模型的生成过程,因此指标可能继承所用扩散模型的感知偏好;论文也指出在训练数据中不存在的失真族(加性像素噪声、局限于小区域的损坏、对比度变化与均值偏移等全局光度变化)上表现较弱,逐失真类型分析显示 CNN 骨干在三个传统合成失真基准的多数失真族上略低于最强人工标注基线。分叉构造本身是随机的,同一参考同一分叉步生成的变体并不相同,论文用 4,800 张图的方差分析论证该扰动远小于标签间距,但这一结论依赖于所测的参考图集合与分叉步范围。此外,人类研究规模有限(单参考研究 30 人、跨参考研究 28 人),跨参考 2AFC 在时间步间隔最窄的区间内人类自身一致性也最低,说明标签在近似平局处区分力有限。论文报告的是 SROCC 等排序相关性,未在正文中给出跨数据集的绝对误差校准结论。
