跳到主要内容
返回时间线
arXiv来源发表:

SoL-Refiner 用单步去噪把低分辨率生成视频精修到 4K,2K 延迟从 57.461 秒降到 6.447 秒

核心概要

该工作提出 SoL-Refiner,一个单步视频精修器,通过高分辨率持续训练、基于帧级奖励模型的强化学习后训练和最终一步蒸馏三阶段配方,把低分辨率生成器输出转换为 4K 视频,并构建 Refiner-Bench 用共享输入协议在约 2K 输出分辨率下比较精修器,在 2K 下其单步模型在 VBench 与 UniPercept 平均值上优于所有被评估的外部精修器,在 3840×2176 下两项指标均超过三步 LTX-2.3 Refiner,完整加速栈在 2K 延迟设定下相对同一基线取得 8.91 倍精修延迟加速。

AI-generated editorial illustration: SoL-Refiner: Speed-of-Light One-Step Refinement for High-Resolution Video

深度剖析

SoL-Refiner 是一个单步视频精修器,能把低分辨率模型输出转换为 4K 视频,只需一次去噪步骤,且无需修改或重训基座生成器即可精修不同基座生成器的输出。 既有精修器通常需要多个目标分辨率去噪步骤,形成第二个采样瓶颈,且多针对特定基座生成器开发、跨生成器迁移很少被评估;该工作把精修压缩到一步并显式评估跨基座迁移。 论文报告在 Refiner-Bench 上,单步 SoL-Refiner 在 VBench AQ、IQ、AVG 与 UniPercept AVG 上优于所有被评估的外部精修器,包括同一步数预算下的 SEEDVR2;其 VBench 与 UniPercept 平均值分别为 0.81048 和 60.4150。

三阶段训练配方把高分辨率精修能力、感知质量和一步推理串起来:持续训练学习低到高保真映射,RL 后训练用帧级奖励模型提升感知质量,最后用 DMD-GAN 蒸馏压缩为一步模型。 与在一步蒸馏中直接用感知奖励监督学生不同,该工作先把帧级奖励用于多步精修器,再经由少步中间学生蒸馏;消融显示 RL 后训练带来最高的 VBench 与 UniPercept 平均值,蒸馏后一步模型仍高于持续训练基线。 训练配方消融给出三阶段数值:持续训练(多步)VBench AVG 0.80888、UniPercept AVG 56.6620;后训练(多步)0.81691 与 61.3170;DMD-GAN(一步)0.81048 与 60.4150。奖励学习消融显示去掉正则化配方或多奖励模型都会降低 VBench 平均值。

Refiner-Bench 是一个由不同视频生成器输出构建的视频精修基准,采用共享输入协议在约 2K 输出分辨率下比较精修器。 该基准把精修性能与上游生成器的选择分离开来,包含来自 WAN 2.1 1.3B、SANA-Video 2B 和 LTX-2 Stage 1 各 50 段共 150 段视频,覆盖 12 个内容组、三档运动水平和六种相机运动类型,其中 WAN 与 SANA-Video 提供分布外输入、LTX-2 Stage 1 提供分布内输入。 论文说明所有方法接收相同的 150 段对齐输入并缩放到统一尺寸,LingBot Stage-2 Refiner 输出一种分辨率、其他精修器输出另一种分辨率,UniPercept 每段视频使用八帧均匀采样。

完整加速栈(一步蒸馏、TAE 与 Sol-Engine)在 2K 延迟设定下把精修延迟从 57.461 秒降到 6.447 秒,相对三步 LTX-2.3 Refiner 取得 8.91 倍加速;跨基座生成器实验也显示低分辨率生成加一步精修可降低端到端延迟并提升质量均值。 该结果把一步蒸馏与系统级加速(TAE 替换完整 VAE、Sol-Engine 的核融合与稀疏注意力)叠加,说明两者提供互补收益,而非仅靠算法步数压缩。 延迟分析在单张 H100 上测量,逐步加入一步蒸馏、TAE、Sol-Engine 得到相邻加速比并给出 57.461 到 6.447 秒的端到端数值;WAN-5B、WAN-1.3B、Cosmos-Nano 的流水线分别降低延迟 54.7%、71.1%、64.4%,同时提升 VBench 与 UniPercept 均值。

启示与展望

该结果面向以低分辨率基座生成器加高分辨率精修的两阶段流水线为架构的生成式视频系统,适用于希望在不修改或重训基座模型的前提下提升局部细节与纹理的开发者;论文说明精修可在原分辨率上改善生成视频,也可伴随上采样,因此既服务于 2K/4K 放大场景,也服务于同分辨率伪影修复。Refiner-Bench 的共享输入协议使不同精修器可在同一批 150 段对齐输入上比较,便于把精修性能与上游生成器选择分离。跨基座实验与 DGX Spark 上的 SoL-H3 部署说明该精修器可作为级联生成中的精修阶段使用。

论文的局限性部分指出,在 Refiner-Bench 上 23 步模型的 VBench 与 UniPercept 平均值高于一步模型,因此一步化存在质量与速度的取舍;精修目标聚焦局部视觉细节并保持基座视频的内容与运动,纠正大的语义、几何或运动错误并非显式训练目标;Stage II 每段视频只评估三帧采样,帧级奖励不直接度量长程时间一致性;Refiner-Bench 覆盖若干基座生成器的 AI 生成视频,相机拍摄退化与更广泛的视频编辑任务不在研究范围内。此外,加载文本中部分数值以占位形式出现(如 3840×2176 处的分辨率写法与若干加速比、延迟数值在正文与附录中的呈现方式),若需精确引用具体数字,仍应回到原文核对表格与图注。

来源