跳到主要内容
返回时间线
arXiv来源发表:

PreviewDiff 把多模态评审放进去噪循环:在 SDXL 与 LTX-Video 上以同等算力超过 Best-of-N

核心概要

PreviewDiff 提出一种免训练测试时搜索方法,在选定的去噪检查点解码中间预览、让多模态评审打分并给出自然语言修正,再据此在语义提示编辑与局部重加噪的潜变量延续上分支、评分并选择性推进,在图像与视频生成基准上以同等算力预算稳定优于 Best-of-N 与标量搜索基线。

AI-generated editorial illustration: PreviewDiff: Multimodal Critic-Guided Search over Diffusion Latents

深度剖析

把扩散采样从标量搜索改写为多模态评审引导的中间潜变量树搜索:节点状态是中间干净潜变量估计、提示条件与历史反馈,动作是评审提出的语义修正加局部重加噪与延续。 此前 Best-of-N 只在完成样本上做最终选择,EvoSearch、粒子采样、Video-T1 等把验证器当作标量奖励或对噪声、粒子、帧候选做搜索;PreviewDiff 让同一个多模态模型既当价值估计器又当语义动作来源,分支落在可解释的对象、属性、关系、动作级修正上。 论文给出完整方法推导,包括 DDIM 与流匹配两种采样器的干净潜变量估计与局部重加噪公式,以及束剪枝树搜索的选择、扩展、推进、回传四步算法。

在图像与视频生成上,PreviewDiff 随去噪步预算增加持续提升,并在每个测试预算上高于同等预算的 Best-of-N。 SDXL 上平均 Gemini 分数从 2.17 升到 2.86,Best-of-N 从 1.91 升到 2.71;LTX-Video 上 PreviewDiff 从 1.99 升到 2.39,Best-of-N 从 1.75 升到 2.13,说明中间反馈不只是低预算下的捷径。 主缩放实验在 SDXL 与 LTX-Video 上进行,预算以去噪步与验证器调用计,并与验证器调用匹配和前向传播匹配两种 Best-of-N 设置对比。

固定预算下跨骨干与基准的迁移性:图像侧在 SDXL、SD-3.5、FLUX.2 上多数指标优于 Best-of-N,视频侧在 LTX-Video 与 Wan 2.2 上优于 Best-of-N,并在 Qwen-3、BLIP-VQA、Qwen-2.5、LLaVA 等辅助评测器上同样改善。 论文用 Qwen-3 同时作为评审与评测器,并报告非 Gemini 评测列,用以说明提升并非只对 Gemini 评审过拟合。 表格覆盖 GenEval2、T2I-CoReBench、T2I-CompBench++ 与 T2V-CompBench、NarrLV、VBench 2.0,并附官方指标下的已发表参考行作为背景。

人类评测中 PreviewDiff 在三方偏好与两两胜率上均高于 EvoSearch 与 Best-of-N,且内容维度提升大于风格维度。 评审被提示聚焦提示遵循,因此搜索直接优化语义正确性而非美学;风格提升较弱被解释为当前评审目标所致。 九名人类评分者,360 个来自 GenEval2 的图像提示与 200 个来自 NarrLV 的视频提示,每个提示与标准 9 次独立评分,方法名隐藏、顺序随机,三方偏好给出自助法置信区间。

启示与展望

该方法面向暴露中间干净潜变量估计、支持受控局部重启的预训练扩散或流匹配模型,且需要可调用的多模态评审;论文在 SDXL、SD-3.5、FLUX.2 与 LTX-Video、Wan 2.2 上验证,图像主缩放基准为 GenEval2,视频主缩放基准为 NarrLV。它适合在提示遵循比美学更重要的场景使用,因为评审被提示聚焦对象、属性、计数等语义正确性。对希望在不微调模型的前提下用额外验证器算力换取更好组合忠实度的团队,这套流程给出了可直接借鉴的检查点解码、语义修正分支与束剪枝组合。

搜索宽度带来最大增益,深度与语义变体增益较小且会饱和,检查点时机上较早干预更好但过早的干净潜变量估计可能不可靠,论文用有界检查点与较小重启深度来平衡这一取舍。剩余失败集中在精确计数、空间关系反转、属性绑定与长程时间状态跟踪,例如要求四个时钟与五只斑点龟、羊与伞的上下关系、蓝色长颈鹿,以及从透明到蓝到绿到黄到橙到紫的颜色序列。风格提升弱于内容提升,作者将其归因于评审目标而非模型能力。此外,论文提到重启深度消融本可单独隔离局部重启的作用,读者可留意这一轴在后续工作中的展开。

来源