RWTD 用奖励加权传输蒸馏把一步生成器的 GenEval 从 0.73 提到 0.80
核心概要
该工作提出奖励加权传输蒸馏(RWTD),一种只需生成样本与标量奖励评估的一步生成器后训练方法,它把当前模型与参考模型各自的奖励倾斜分布混合成自适应目标,并用特征空间最优传输与不动点回归实现,在一步 SANA Sprint 1.6B 上把 GenEval 从 0.73 提升到 0.80,并在偏好对齐实验中表现出跨奖励泛化。
深度剖析
RWTD 构造了一个随训练演化的对齐目标:Qβ,ρ[pθ]=(1−ρ)Tβ,r[pθ]+ρTβ,r[pref],即分别对当前分布与参考分布做奖励倾斜后按参考质量 ρ 混合。 此前的一步对齐方法多只对齐固定的奖励倾斜参考分布,或依赖可微奖励、似然代理、多步去噪轨迹;作者称 RWTD 是首个显式以“分别归一化的当前与参考奖励倾斜分布之混合”为目标的一步对齐方法。 论文给出该目标的粒子化实现:对当前粒子与参考粒子分别做 softmax 奖励加权(式 6),得到经验目标测度,仅需生成样本与标量奖励,不需要似然或奖励梯度。
该目标通过特征空间最优传输与部分传输回归落地:在冻结视觉编码器(SANA Sprint 用 DINOv2,SDXL Turbo 用 MAE)的特征空间用 Sinkhorn 求熵正则最优传输耦合,再把每个源特征朝其条件均值部分移动 η 步,并以停止梯度的特征回归损失蒸馏回生成器。 与直接奖励反传、Stein 变分梯度下降加核密度估计、或基于排序偶极偏好场的做法不同,RWTD 用传输几何给出样本级的分配,且不要求奖励梯度、核密度估计或多步扩散教师。 算法 1、2 给出完整流程;消融显示重心与采样两种目标分配表现相近,而移除传输几何的独立奖励加权回归(RWR)在 CLIP 与 PickScore 上相对基线退化,作者据此认为收益主要来自特征空间 OT 诱导的样本级分配。
理论分析刻画了混合奖励倾斜的不动点:当 0<ρ≤1 时不动点与 H(λ)=1/ρ 的解一一对应且唯一,形式为 p∞(x)=ρ/Zref·pref(x)exp(βr(x))/(1−λexp(βr(x))),ρ=1 时退化为标准奖励倾斜参考分布,ρ 减小则 λ 增大、对高奖励区域的放大更强;ρ=0 的纯在策略端点没有唯一不动点,会向奖励最大化区域集中。 作者指出混合目标并不等价于插值模型参数或仅改变奖励温度,而是定义了一族带有奖励相关有理放大因子的新不动点分布。 命题 5.1 给出推导与唯一性证明,附录 A.2 给出存在性条件与 dλ/dρ<0 的隐函数求导结果;作者明确说明这些结论在理想化条件下提供直觉而非严格保证。
实验上,RWTD 把一步 SANA Sprint 1.6B 的 GenEval 从 0.73 提升到 0.80,超过同规模多步模型(Playground v3 0.76、FLUX.1 Dev 0.66、SD3.5-L 0.71),并把 SDXL Turbo 从 0.55 提升到 0.61;用 HPSv2 训练时它是唯一同时改善全部五项偏好指标与域外 GenEval 的方法(GenEval 0.75,而 FAV、DrPO、DRaFT 分别降到 0.72、0.72、0.62)。 在 SANA Sprint 1.6B 上 DrPO 与 FAV 仅达到 0.75 与 0.73;梯度类方法虽在 HPSv2 上优化更强,却使 CLIP 低于基线,作者将其描述为奖励过优化导致的风格化与语义退化。 GenEval 用官方代码库每提示采样四张图;偏好对齐在 PartiPrompts 上每提示五张图,报告 PickScore、HPSv2、Aesthetics、CLIP、ImageReward;训练用 LoRA,SANA 用 8 卡、SDXL Turbo 用 4 卡,并给出 GPU 小时成本对比(GenEval 上 RWTD 197 对 DrPO 194、FAV 431)。
启示与展望
该结果面向需要把已有一步生成器对齐到新标量奖励(包括不可微奖励)的研究与工程场景,前提是能获得参考生成器、冻结特征编码器与可采样的奖励评估;作者强调方法不假设似然、分数函数、奖励梯度或多步去噪轨迹,因此适用于黑盒奖励与隐式生成器。理论部分在理想化总体层面给出不动点刻画与传输步长不变性,实践版本用有限小批量、熵正则 OT 与重心投影近似这些动态。实验覆盖 SDXL Turbo 与 SANA Sprint 1.6B 两个骨干、GenEval 组合性奖励与 HPSv2 偏好奖励,并给出 GPU 小时成本,便于判断在自有算力下的可行性。
作者自己说明理论结果在理想化条件下提供的是直觉而非严格保证,实际训练使用有限小批量、熵正则 OT 与重心投影来近似。超参扫描显示奖励温度 β 增大时 HPSv2、Aesthetics、ImageReward 上升而 CLIP 逐渐下降,ρ=0 的纯在策略训练会显著降低多样性(平均成对 LPIPS 从 0.652 降到 0.414),因此 β 与 ρ 的取舍仍是需要按场景权衡的开放问题。所有对齐模型的多样性都低于基座模型,参考混合只是缓解而非消除这一损失。此外,实验集中在图像生成与图像奖励模型上,方法在视频、三维或其他模态以及更复杂奖励下的表现尚待检验。
