跳到主要内容
返回时间线
arXiv来源发表:

iADD用早期时间步更新与Feynman-Kac分支,在图像与3D场景生成中同时提升奖励对齐、多样性与稀有提示成功率

相关研究与后续进展

核心概要

作者提出iADD,一种基于离散时间扩散模型强化学习后训练的方法,通过理论分析指出更新早期去噪时间步比只更新后期时间步更有利于保持多样性,并引入增量式稀疏时间步课程与离散时间Feynman-Kac路径剪枝和分支;在稀有提示图像生成、消失点校正和3D室内场景合成三类任务上,iADD在奖励、Inception Score、稀有事件成功率与AUC上均优于DDPO、B2-DiffuRL等对比方法,且其组件可与GRPO式优化组合。

AI-generated editorial illustration: iADD: Improving Alignment and Diversity in Diffusion Policy Optimization

深度剖析

论文从理论上分析了时间步选择对多样性的影响,提出命题表明在固定优化预算下,均匀采样时间步比只更新后期时间步产生更大的总扰动幅度,而稀疏更新比全时间步更新更好地保持先验分布的概率体积。 此前工作B2-DiffuRL等主张只更新后期时间步,本文给出相反的理论预测并给出可操作的课程设计原则。 命题1、命题2及补充材料中的证明;训练中直接测量显示均匀采样时间步的累积输出扰动始终大于仅后期更新,且在匹配计算量下稀疏更新将全生成器对数体积测度改善约若干nats(配对差异含SEM,基于24个提示-种子对)。

论文提出iADD训练方法,将增量式稀疏时间步课程与离散时间Feynman-Kac分支结合,通过剪除低奖励期望路径提升对齐、通过分支高潜力路径鼓励多样性。 此前Feynman-Kac引导主要用于推理时样本改进,本文将其用于训练,并与时间步课程组合。 在图像生成、消失点校正和3D室内场景合成三类任务上的实验,以及针对每个组件的消融;消融显示朴素组合(如分支加后期时间步更新或仅FK)仅带来约小幅IS提升,而完整的增量FK分支方案带来更大增益。

在图像生成任务上,iADD在奖励、IS、稀有事件成功率和AUC上均优于DDPO与B2-DiffuRL;在消失点校正上奖励与稀有事件成功率提升更明显;在3D室内场景上碰撞率低于对比方法。 对比方法在提升奖励时往往牺牲IS或增加碰撞,iADD在相同奖励目标下保持更好的多样性、稀有事件成功率和物理合理性。 表3报告图像生成奖励0.3553、IS 1.3241、稀有事件成功率66.85%、AUC 77.7%,对比DDPO的0.3417、1.2786、24.81%、53.8%与B2-DiffuRL的0.3452、1.2728、24.22%、58.7%;消失点校正奖励0.7763、稀有事件成功率95.11%;3D碰撞率59.20%低于DDPO的63.39%与B2-DiffuRL的64.06%。

iADD的轨迹引导与稀疏课程可与GRPO式优化组合,组合后在CLIPScore和稀有事件成功率上进一步提升。 表明该方法不绑定于特定DDPO目标,而是与底层策略优化器互补。 表4显示iADD+GRPO的CLIPScore为0.4126、稀有事件成功率88.33%、LPIPS 0.7778,高于DanceGRPO的0.3886、61.67%、0.7624与BranchGRPO的0.3854、56.67%、0.7447。

启示与展望

该工作面向使用离散时间扩散模型、以稀疏终端奖励进行在线强化学习微调的场景,适用于图像生成、消失点校正与3D室内场景合成等任务;方法以DDIM采样与LoRA微调为基础,训练时使用Feynman-Kac粒子采样与增量时间步课程。对于希望在不引入额外偏好数据的前提下改善奖励对齐并保持多样性的研究者与工程实践者,该结果提供了可复用的时间步选择原则与轨迹引导组件,并显示这些组件可与GRPO式优化组合。

理论命题建立在理想化优化与一阶敏感性假设之上,作者说明其给出的是比较性预测而非精确训练界;训练中直接测量在非线性微调动态下检验了这些预测。奖励从含噪中间状态估计在早期时间步可能不可靠,3D场景中物体尺寸与位置等几何属性在去噪中途难以准确恢复,作者建议未来研究更准确的终端奖励估计器。训练成本高于DDPO,主要来自Feynman-Kac粒子采样,尽管增量时间步策略部分降低了开销。CLIP奖励存在已知失效模式,作者以“chicken playing chess”为例说明可能对语义对齐较弱的图像给出高分。这些是范围与开放问题,而非对工作的否定。

来源