MEF-TBN:面向多曝光图像融合的三分支特征提取与色彩增强网络
核心概要
该工作提出 MEF-TBN,一个在 YCbCr 空间工作的三分支网络,用上下文聚合注意力网络(CAAN)分支提取多尺度局部特征、用 transformer 分支以多头自注意力建模全局长距离依赖、并用色彩增强分支学习亮度与色度之间的映射关系,两个特征分支在低分辨率下生成权重图、经含三个 merger block 的合并模块细化后由导向滤波联合上采样(GFU)恢复到原分辨率,在三个 MEF 数据集上与 9 种代表性方法比较,在 AG、EI、SF 等图像特征类指标和 QCB、VIF、NIQE 等人类感知类指标上取得最优,MEF-SSIM 排名第二,相对 SwinFusion 在 QCB、VIF、NIQE、MEF-SSIM 上平均提升 11.5
深度剖析
提出以 CAAN 分支与 transformer 分支分别承担局部多尺度特征与全局长距离依赖建模,并用合并模块(三个 merger block)以逐元素相加加卷积细化的方式整合两路低分辨率权重图,再由导向滤波联合上采样(GFU)生成原分辨率权重图。 相较此前混合 CNN-Transformer 方法常用的简单拼接或复杂注意力融合,该设计保留两路特征的原始表示并以卷积细化,作者报告消融中移除任一分支都会使 MEF-SSIM、QCB、VIF 平均值明显下降,且用交叉注意力式融合替换后三项指标降至 0.9711、0.5138、0.9026。 在 SICE 训练集(589 个静态序列,每序列至少 3 个曝光)上训练,在 MEFB 等三个测试数据集上做定量与主观比较,并给出三分支、合并模块、上采样方式、分辨率与网络深度宽度的消融表。
提出色彩增强分支,以最过曝与最欠曝图像连同融合后的 Y 通道作为输入,用对称编解码全卷积网络学习亮度与色度的映射,替代对 Cb、Cr 的简单加权融合。 针对多数 MEF 方法只对亮度分量设计融合策略、对色度分量做简单加权求和而导致过曝或欠曝区域色彩失真的问题,该分支直接建模色彩与亮度的关系;消融显示移除该分支后 Colorfulness Index 平均值明显下降。 消融实验以 MEF-SSIM、QCB、VIF 与 Colorfulness Index 为指标,并配有主观对比图;训练时从每个序列中选取最过曝、欠曝与中间曝光图像用于该分支。
在统一评测下报告了与 9 种代表性 MEF 方法的比较结果,包括 10 项指标、用户偏好研究与效率对比。 作者报告其方法在 EN、AG、EI、SF、SD、QCB、VIF、NIQE 上最优,在 QY 与 MEF-SSIM 上第二;8 名志愿者(4 名研究者与 4 名非专业参与者)的盲选成对偏好比较中该方法偏好率 86.1% 排名第一,UltraFusion 为 73.1%;模型为 23.5M 参数、26.7G FLOPs、94MB,低于 SwinFusion 的 34.2M、41.5G、136.8MB 与 UltraFusion 的 217M、126.3G、868MB。 定量结果以平均值±标准差与 95% 置信区间给出,并对主要指标做 Wilcoxon 符号秩检验(p<0.05);部分对比方法在相同 SICE 数据上重训,部分使用官方预训练模型。
启示与展望
该结果面向静态场景的多曝光融合,输入图像需已良好对齐,方法在 YCbCr 空间处理并支持任意分辨率与两张以上输入;作者报告其在 512s 训练、512s 至 2048s 测试时表现稳定,因此对高分辨率静态序列、需要自然色彩与人类感知质量的摄影或图像增强流程较为适用。
作者指出当前框架缺少运动检测或图像对齐机制,动态场景会产生鬼影,未来需引入对齐或去鬼影模块;此外,正文中部分公式、表格数值与图注在本次加载的文本中被截断,例如训练分辨率、导向滤波半径与部分消融数值的具体取值无法完整核对,读者若需复现应回到原文图表确认这些细节。
