EVA 用自回归潜先验替代标准高斯先验,在 ImageNet 与 VGGSound 上以更少推理参数取得有竞争力的生成质量
相关研究与后续进展核心概要
作者提出 Empirical Variational Autoencoder(EVA),在 VAE 的 ELBO 框架下用一个从数据中经验学习的自回归潜先验取代固定的标准高斯先验,使先验与后验对齐;在受控玩具基准、ImageNet 256×256 图像生成和 VGGSound 声音生成上,EVA 取得与自回归生成器(GMM 头、扩散头)有竞争力的结果,同时祖先采样推理明显快于基于扩散的自回归方法,且与推理时 Transformer 深度相同的 AR-Diffusion 相比 FID 更低、推理参数更少。
深度剖析
EVA 把 VAE 的固定标准高斯潜先验替换为由额外 predictor 网络从训练数据经验学习的自回归先验,每个潜 token 条件于全部先前潜位置,从而让先验具备表示整个先前潜序列依赖关系的能力。 传统 VAE 用跨空间或时间索引共享的标准高斯先验,与后验中残留的依赖结构不匹配;已有工作通过 VampPrior、重采样先验、流先验或分层 VAE 增强先验,但分层 VAE 在每个空间潜图内部仍使用因子化条件分布。EVA 的改动仅是在 Causal VAE 之上增加一个线性层来预测潜先验。 论文给出 EVA ELBO 的推导(式 15–17)与条件生成扩展(式 18–23),并在玩具实验中与 MSE-AR、GMM 头、Causal VAE 四类生成族做理论对比。
在受控玩具基准上,EVA 生成的样本更少落在真实模式之间,质量更集中于真实模式。 MSE 训练的 AR 落入平均化陷阱,无法恢复多模态联合结构;GMM 头受预定义混合分量数限制,当可见模式数超过分量容量时被迫用单个分量覆盖多个模式;Causal VAE 能捕捉主要簇但仍产生可观的模式间样本。 玩具过程由一维潜序列与一维观测构成,潜转移分支数取 1、2、3,观测模式数取 1、2、3,结果以二维空间中的样本可视化呈现(Fig. 3)。
在 ImageNet 256×256 与 VGGSound 上,EVA 在可比推理成本下取得有竞争力的 FID,并显著快于扩散式自回归方法。 AR-Diffusion(321M)取得最佳指标但需要迭代去噪,推理约比 EVA 慢 10 倍;在推理时 Transformer 深度相同时,AR-Diffusion(236M)的 FID 明显更差,而 EVA 以更少推理参数取得更低 FID。Causal VAE 表现不佳,说明仅把 VAE 解码器改为因果并不足以获得高质量序列生成。 所有模型共享 170M 参数、24 层、隐藏宽度 768 的 Transformer 主干;ImageNet 生成 50k 样本,VGGSound 生成 15446 样本,报告 FID、IS、训练与推理参数量及归一化推理时间(Table 1)。
EVA 在提升生成 FID 的同时保持与 Causal VAE 相当的 reconstruction fidelity,并形成语义结构化的潜空间。 经典单全局潜瓶颈 VAE 存在重建保真度与先验正则之间的权衡;在多潜变量设定下,Causal VAE 与 EVA 的 rFID 相近,而 EVA 的生成 FID 大幅改善,说明潜容量充足时两个目标不必紧密耦合。 Table 2 报告 rFID 对比;Fig. 4 用双向 KL 散度显示 EVA 潜空间中语义相似的 patch 具有相似的潜分布,而 Causal VAE 的后验潜分布仍存在空间结构化变化。
启示与展望
该工作面向连续值序列的生成建模,适用于图像与音频等可被预训练 VAE 编码为连续潜 token 的数据;方法在 ImageNet 256×256 与 VGGSound 两个闭集基准上验证,模型规模为中等(主干 170M 参数,另有 EVA-S 与 EVA-L 变体),训练使用八块 NVIDIA RTX5090(32GB)GPU,ImageNet 约 3 天、VGGSound 约 12 小时。条件生成通过条件编码器、条件解码器与条件 predictor 实现,并可将 CFG 施加于预测潜分布的均值。潜维度分析显示 128 维在 ImageNet 上取得最佳 FID,过大潜空间反而增加先验建模与采样难度。作者指出下一步可扩展到更大规模与更多样的下游任务,如 text-to-image、text-to-speech 与多模态数据生成。
EVA 目前把空间潜图线性化为 1D 因果序列,未显式利用二维空间结构,专门面向空间数据的自回归先验是否进一步提升图像生成仍是开放问题。实验限于 ImageNet 与 VGGSound 的闭集生成基准与中等模型规模,更大规模与更多样任务上的表现有待验证。VGGSound 数据集目前仅由第三方提供且缺少部分原始数据,这可能影响该基准上结果的可复现范围。此外,潜维度与模型规模的分析基于 ImageNet 上的 CFG 尺度扫描,其他模态与数据规模下的最优配置仍需进一步考察。
