NVIDIA 把蒸馏做成可插拔 LoRA:一次训练后免训练部署到 54 个视频模型
核心概要
LongLive-Plug 提出一种“一次蒸馏、处处复用”的框架,在基座模型上把单次前向的 CFG、四步采样和长上下文纠错分别蒸馏成可复用的 LoRA,无需下游再训练即可插拔部署到三个骨干家族共 54 个下游视频模型,并在 SCOPE 与 Wan2.2-Fun-5B-Control 上取得优于朴素四步采样、接近逐任务蒸馏的效果。
深度剖析
该工作把加速能力从“每个专用模型各蒸一次”改为“每个骨干家族蒸一次”,把 CFG 蒸馏、少步蒸馏和长上下文纠错分别封装为独立的功能性 LoRA,在基座模型上训练后直接挂到兼容的下游模型上,保留其任务权重,无需下游训练或再蒸馏。 此前 CausVid、Self Forcing 一类方法把 CFG 与少步生成联合蒸馏,FlashMotion、StreamAvatar、DreamDojo 等则针对各自专用检查点单独蒸馏;LongLive-Plug 改为按骨干家族一次性蒸馏并跨兼容后代复用。 论文报告在三个骨干家族(Wan2.1-14B、Wan2.2-TI2V-5B、MiniMax-H3)共 54 个下游模型、八类任务上完成免训练部署验证,覆盖世界模型、机器人、编辑与多模态生成等。
把 CFG 与少步生成解耦成两个 LoRA 后,CFG LoRA 的推理权重可以当作“引导旋钮”,在固定少步权重的前提下近似线性地调节文本引导强度,从而适配不同下游任务对引导强度的偏好。 联合蒸馏的 LoRA 一旦整体缩放会同时扰动少步修正,论文报告在 SCOPE 上全局缩放会导致画面变暗、扭曲并在较大权重下严重崩溃;解耦后单独调 CFG 权重则能在四步生成下保持几何与前景可辨。 论文给出近似线性响应公式,并在 Wan2.2-TI2V-5B 的原生 50 步 FlowUniPC 调度与 SCOPE 四步设置下做经验验证,同时说明该对应关系是近似的,非线性响应与下游特化会改变有效引导。
论文报告了两条关于“蒸馏出的能力能否迁移”的经验规律:适配器秩过小可能拟合基座教师却迁移不佳,因此需要同时看源端拟合与下游迁移;蒸馏数据的提示词覆盖越广,迁移越好。 这为“如何训练一个在蒸馏检查点之外仍然有用的加速器”给出了可操作的设计依据,而不只是报告单点结果。 秩消融在固定教师、提示词、目标层、优化预算与检查点选择规则下,三次秩翻倍使迁移单调改善;数据消融在固定教师、秩、目标层、优化预算与训练行数下,提示词多样性下降时 FVD 单调上升。
长上下文蒸馏把自回归 rollout 中累积误差的纠正能力也做成可复用 LoRA,迁移到 ReWorld 与 Matrix-Game 3.0 两个自回归世界模型后改善了长视频质量。 该能力此前通常与具体模型绑定,这里被证明可以在支持因果自回归推理的兼容模型间复用,且无需目标端训练。 在 ReWorld 上以 16–64 秒、匹配提示词与相机轨迹比较 24 步原生与四步 +Long,64 秒时七维均值由 提升到 ;在 Matrix-Game 3.0 上 62.18 秒处,50 步原生、官方三步任务蒸馏与四步 +Long 的七维均值分别为 、 、 ,论文说明存在指标相关的取舍。
启示与展望
该框架的适用前提是下游模型必须是同一基座模型的兼容后代;长上下文纠错 LoRA 只适用于已经支持因果自回归推理的模型,因为 LoRA 更新本身不改变注意力掩码。论文给出的部署验证覆盖三个骨干家族共 54 个下游模型与八类任务,并说明可能支持更多兼容模型。对希望省去逐任务数据采集与再蒸馏的团队,这套方案在基座蒸馏完成后即可直接挂载使用;CFG 权重作为引导旋钮的用法面向需要在四步生成下按任务调节文本引导强度的场景。
CFG 权重与引导强度之间是近似线性关系,论文明确说明非线性响应与下游特化会改变有效引导,因此迁移后仍可能需要按任务调整权重,且权重过大时视觉质量会下降。长上下文迁移在 ReWorld 与 Matrix-Game 3.0 上呈现指标相关的取舍,例如 ReWorld 上背景一致性反而更低。附录中 MiniMax-H3 的十组对比为单种子案例、没有重复运行的置信区间,且原生默认只是参考工作点而非真值,E4 到 S4 同时改变了适配器与采样器,因此这些例子评估的是完整部署配方而非单独加 LoRA 的因果效应;不同 H3 后端的运行时统计口径也不同,计时只宜在同一任务内比较。此外,本次读取的文本中部分数值以占位形式呈现,具体指标数值需回到原文表格核对。
