arXiv 2026年10月5日作者提出 Empirical Variational Autoencoder(EVA),在 VAE 的 ELBO 框架下用一个从数据中经验学习的自回归潜先验取代固定的标准高斯先验,使先验与后验对齐;在受控玩具基准、ImageNet 256×256 图像生成和 VGGSound 声音生成上,EVA 取得与自回归生成器(GMM 头、扩散头)有竞争力的结果,同时祖先采样推理明显快于基于扩散的自回归方法,且与推理时 Transformer 深度相同的 AR-Diffusion 相比 FID 更低、推理参数更少。作者提出 Empirical Variational Autoencoder(EVA),在 VAE 的 ELBO 框架下用一个从数据中经验学习的自回归潜先验取代固定的标准高斯先验,使先验与后验对齐;在受控玩具基准、ImageNet 256×256 图像生成和 VGGSound 声音生成上,EVA 取得与自回归生成器(GMM 头、扩散头)有竞争力的结果,同时祖先采样推理明显快于基于扩散的自回归方法,且与推理时 Transformer 深度相同的 AR-Diffusion 相比 FID 更低、推理参数更少。EVA 用自回归潜先验替代标准高斯先验,在 ImageNet 与 VGGSound 上以更少推理参数取得有竞争力的生成质量作者提出 Empirical Variational Autoencoder(EVA),在 VAE 的 ELBO 框架下用一个从数据中经验学习的自回归潜先验取代固定的标准高斯先验,使先验与后验对齐;在受控玩具基准、ImageNet 256×256 图像生成和 VGGSound 声音生成上,EVA 取得与自回归生成器(GMM 头、扩散头)有竞争力的结果,同时祖先采样推理明显快于基于扩散的自回归方法,且与推理时 Transformer 深度相同的 AR-Diffusion 相比 FID 更低、推理参数更少。作者提出 Empirical Variational Autoencoder(EVA),在 VAE 的 ELBO 框架下用一个从数据中经验学习的自回归潜先验取代固定的标准高斯先验,使先验与后验对齐;在受控玩具基准、ImageNet 256×256 图像生成和 VGGSound 声音生成上,EVA 取得与自回归生成器(GMM 头、扩散头)有竞争力的结果,同时祖先采样推理明显快于基于扩散的自回归方法,且与推理时 Transformer 深度相同的 AR-Diffusion 相比 FID 更低、推理参数更少。