跳到主要内容
返回时间线
arXiv来源发表:

ImIR 用退化图像自身的嵌入替代文本提示,让一个冻结的 Qwen-Image-Edit 加单个低秩适配器在六项复原任务上全面超过文本条件,并在无退化标签时仍能工作。

核心概要

该工作把一体化图像复原重新表述为由图像自身导出的指令引导的编辑:一个轻量 token mapper 从退化图像的视觉-语言嵌入预测干净图像的指令嵌入,替代文本提示,在冻结的 Qwen-Image-Edit 上以单个低秩适配器、约 688 对图像、单卡约三小时训练覆盖低光增强、去雨、去雾、去模糊、去噪与 JPEG 压缩伪影去除六项任务,在匹配比较中于全部六项任务上优于文本条件,并支持无退化标签的任务无关复原与通过缩放指令获得一族有效复原。

AI-generated editorial illustration: ImIR: Image-Instruction Tuning for All-in-One Image Restoration

深度剖析

把一体化复原的条件从离散文本提示换成由退化图像导出的连续指令向量,从而免去逐任务的提示工程。 此前的同类做法(如 Edit2Restore)用任务特定的文本提示驱动编辑模型;本文让退化图像自身的视觉-语言嵌入经 token mapper 修正为干净目标的指令嵌入,文本提示留空。 在相同骨干、相同测试输入、相同预处理与指标代码下的匹配比较中,图像指令在六项任务上均领先文本适配器;低光上为 21.3 dB 对 16.3 dB,去雨上为 33.2 dB 对 32.5 dB。

任务无关变体在没有任何退化标签时与任务感知模型表现相当,而文本条件在去掉任务标签后明显退化。 文本适配器在换成单一中性提示后崩溃(去雨从 32.5 dB 降到 17.5 dB),逐图提示也仅与中性提示相差约 1 dB;任务无关 ImIR 在全部六项任务的 PSNR 上超过任务感知的文本适配器。 任务无关 ImIR 与任务感知 ImIR 在低光上为 21.2 dB 对 21.3 dB、去雨上为 33.0 dB 对 33.2 dB,其余任务同型;作者据此把差异归因于图像条件而非编辑器或适配器。

指令是连续向量,缩放其残差位移可在目标不唯一的任务上产生一族有效复原。 固定文本提示没有可比的连续控制;本文在低光增强上通过缩放参数得到从接近暗输入到过亮的多种曝光,在去雾上随缩放逐步接近真值。 以平均亮度和平均颜色衰减先验读数反映趋势;作者指出该控制轴对目标为区间的任务有意义,对目标为点的任务近乎无效。

消融在图像空间把增益归因于预测出的指令本身,而非退化图像已携带的线索。 相对恒等基线(无 mapper),mapper 带来 1 至 5 dB 提升;用干净嵌入的 oracle 确认干净嵌入是有用指令,并界定 mapper 的剩余空间。 ImIR 在每项任务上至少弥合恒等至 oracle 差距的 82%;加入全局上下文分支使嵌入空间 MSE 相对恒等基线的下降从 25.1% 提升到 30.3%,余弦相似度从 0.724 升至 0.742,图像空间对应 1 至 5 dB。

启示与展望

该结果面向以配对数据评测的全参考复原场景:六项任务各用一个基准(LOLv2-real、Rain100L、RESIDE SOTS、GoPro、SIDD、Kodak),训练集跨任务均衡、共 688 对图像,骨干为冻结的 Qwen-Image-Edit(主报 2511 版本),适配器为秩 16 的低秩适配器,mapper 与适配器共学习 326M 参数(适配器 235M、mapper 91M),单张 H100 约三小时。它使研究者与工程实践者可以在不写提示、不给退化标签的前提下用单个模型覆盖多类退化,并在目标不唯一的任务上通过缩放指令选择曝光等操作点。作者明确把效率主张限定在数据量与训练时间上,不做算力归一化比较;从零训练的全数据专家在若干任务的全参考保真度上仍然领先,本文不主张在该项上超越它们。

作者未做专门的泛化研究,也未声称泛化结果;盲测与真实世界基准被留作未来工作,因此任务无关变体在分布外退化上的表现仍是开放问题。推理为迭代采样,约一百万像素、批大小一、30 步时每张图 14 秒,慢于前馈专家;生成式先验可能合成看似合理但不忠实的细节。去雨上图像指令与文本适配器在 PSNR 与 SSIM 上接近统计平局,去噪 LPIPS 的胜率 69% 建立在仅 32 张图的小测试集上。此外,本文档为全文解析,但表格与图以文本形式给出,若需核对具体数值与图 3、图 4 的视觉对比,仍应查阅原文图表。

来源