跳到主要内容
返回时间线
arXiv来源发表:

图像质量打分不再依赖人评:从冻结编码器取一次雅可比,分辨率翻倍相关性几乎不动

导语

一种从冻结视觉编码器输出灵敏度导出的感知距离,只用100张无标注图像拟合一次,在四个图像数据库上取得最高平均相关性,且分辨率翻倍时相关性几乎不变。

AI-generated editorial illustration: JLD: Perceptual Distance Through A Jacobian Lens

正文

图像压缩、复原和生成都需要衡量两张图在人眼里差多少,而像素误差把每个像素变化同等看待,与人眼不一致。 此前最准的感知距离通常拟合人类评分,因而被绑定在固定的数据和分辨率上。 在TID2013上把图像分辨率从256翻倍到512像素后,DISTS与人类评分的相关性从0.815降到0.717,LPIPS-VGG从0.757降到0.661。

新距离把早期图块特征的局部性与后期表示所携带的感知灵敏度结合起来,权重来自编码器输出对早期图块的雅可比。 此前要么直接用早期特征、对所有方向一视同仁,要么用已经丢失空间细节的后期表示。 在冻结的DINOv2-S上,不加权的早期特征相关性为0.784,输出词元为0.742,加权后升到0.850。

雅可比透镜是特征空间中的一个固定度量张量,只保留384个特征方向中贡献最大的64个,占其迹的76.5%。 此前没有感知距离以这种方式把网络输出灵敏度回传到早期特征。 透镜只用100张无标注DIV2K图像拟合一次,在一块A100上耗时约35秒,不使用图像对、失真或人类标签。

同一构造还能换成视频编码器,用16维透镜捕捉单帧看不到的闪烁等时间效应。 此前逐帧的图像距离无法覆盖这类时间效应。 在Waterloo IVC 4K的240对视频上相关性为0.786,VMAF为0.611;在留出的AVT-VQDB-UHD-1上为0.912,VMAF为0.932。

接下来

下一步可以在音频、医学影像或三维等其它可微编码器上按同一流程拟合透镜,只需约100张与评测集不重叠的无标注样本,并保存语料清单与随机种子。需要严格伪度量的应用可以只用透镜项,它满足三角不等式;把完整距离当作训练损失时,需要留意被丢弃的320个特征方向构成的零空间。

透镜项在320个被丢弃方向上不可见,直接对它做优化可能利用这些方向;完整距离不保证满足三角不等式,审计中每百万三元组最多出现107次违反。在PIPAL复原输出和TID2013全局对比度变化上表现较弱,留出视频上仍低于在人类视频评分上训练过的VMAF。人类研究只有十名参与者,且方法假设输入已空间对齐。

来源