跳到主要内容
返回时间线
arXiv来源发表:

把“细化”本身当作编辑界面:RefineEdit 如何在生成式细化网络中免训练改图

核心概要

该工作提出 RefineEdit,一个免训练的提示到提示图像编辑框架,它把编辑定位与内容生成耦合在生成式细化网络(GRN)的全局二值码细化过程中:从源图细化的中间状态分支出编辑分支,用两分支对同一源采样比特的概率有符号差来选出可编辑的位置与比特,未选中的比特复制演化中的源状态,并以自适应空间冻结与有限比特锁定稳定跨步决策,在 PIE-Bench 九个编辑类别上取得最佳背景保持指标(PSNR、LPIPS、MSE、SSIM)以及最高的整图与编辑区域 CLIP 分数。

AI-generated editorial illustration: Refinement Is Inherently Editable: Training-Free Prompt-to-Prompt Image Editing with Generative Refinement Network

深度剖析

提出首个面向 GRN 生成图像的免训练提示到提示编辑框架,把编辑表述为定位与内容生成共同演化的耦合细化过程。 此前免训练编辑多依赖扩散模型的空间控制(掩码、注意力图、特征注入)或自回归模型的固定因果解码顺序;该工作把编辑接口移到 GRN 的全局可重访二值码上,作者称这是首次将 GRN 从图像生成扩展到免训练图像编辑,此前仅有基于训练的 GRN 视频编辑工作。 论文给出方法推导、算法流程与在 PIE-Bench 九类编辑上的定量对比,并附消融、超参对比与用户研究;属于方法论文加基准评测的证据形态。

用两分支对同一源采样比特的概率有符号差(signed probability drop)同时定义空间掩码与比特级掩码,把“哪些位置可改”与“该位置内哪些比特可改”分开。 扩散编辑器的空间控制常以掩码或注意力为中介,其精度直接决定编辑质量;这里把编辑证据落到单个二值坐标上,并让证据随图像演化被重新评估。 论文给出概率差的定义式、阈值化规则与源锚定路由公式,并在消融中分别移除空间冻结与比特锁定以观察各自作用。

自适应空间冻结与有限比特锁定用于稳定跨细化步的路由决策:前者在初始编辑响应足够强时固定空间掩码以限制掩码扩张,后者让最近若干步内曾同时通过空间与比特判据的比特保持编辑许可。 瞬时选择会因分数波动而反复开关比特;这两种机制把“编辑许可”与“比特取值”解耦,锁定的是许可而非数值。 论文给出响应度量与锁定窗口的定义,并报告移除任一机制后的定性差异(无冻结时掩码蔓延到机器人周围的屋顶与手部背景,无比特锁定时手指保留更多源外观),定量消融表在文中标注为待替换为实测结果。

在 PIE-Bench 九个编辑类别上,RefineEdit 在背景保持的 PSNR、LPIPS、MSE、SSIM 四项上取得所比较方法中的最佳成绩,并取得最高的整图与编辑区域 CLIP 分数。 相对流式方法 FlowEdit,论文报告 PSNR 从 25.03 提升到 30.50、LPIPS 从 0.062 降到 0.037;作者同时指出编辑区域相对 LEDits++ 的优势较小,因此将其解读为语义对齐相当而保持更好,而非显著的语义增益。 评测使用 560 组源/编辑提示对、九类编辑,所有基线编辑同一张 GRN 源图,评测掩码由 Grounded-SAM 生成且不提供给方法本身;单次编辑平均耗时 26.77 秒(单张 A100,重复十次取平均,不含 I/O),与 FlowEdit 相当、低于 RF-Inversion,约为 PnP 与 PnP-DirectInv 的加速比。

启示与展望

该结果面向使用 GRN 生成源图、并希望在不重训模型、不引入外部掩码或注意力控制的前提下做提示到提示编辑的场景;它使编辑定位与内容生成在同一细化过程中共同演化,对需要强背景保持的局部编辑(替换、增删、姿态、颜色、材质、背景与风格)尤其相关。论文指出后续方向包括扩展到任意图像输入以及减少按类别调参。

论文自述的开放问题包括:方法依赖 GRN 源轨迹而不支持任意真实图像;性能受预训练生成器与概率定位精度影响;冻结不完整掩码可能把目标区域排除在编辑之外,而掩码持续扩张又可能改动无关内容;有限比特锁定保持可编辑性但不保证语义变化达成;切换步与阈值仍需调参,且类别级配置在评测基准上选取,对未见提示与编辑分布的泛化有待检验。此外,消融部分的定量表在文中标注为待替换为实测结果,因此两种稳定机制各自的量化贡献仍需以最终数据为准;本次读取为全文,但图表数值与附录细节的呈现程度会影响对个别结论的核对。

来源