跳到主要内容
返回时间线
arXiv来源发表:

HiRAE用深度分组残差预算融合DINOv3-L全部24层,把ImageNet-256重建FID从0.299降到0.209并让GenEval微调后升至87.70

核心概要

HiRAE提出一种分层表示自编码框架,把冻结DINOv3-L编码器的全部24层按深度分成浅、中、深三组,每组学习对最深层的残差修正并用逐组范数上限约束(越浅预算越紧),在保持潜变量token数与通道维度不变的前提下联合训练融合模块与解码器,使ImageNet-256重建FID从RAEv2的0.299降至0.209、PSNR从22.667升至26.377 dB、LPIPS从0.074降至0.043,引导生成gFID从1.060降至1.038,文本到图像在GenEval、DPG-Bench、GenAI-Bench上预训练与监督微调后均优于RAEv2,微调后GenEval从84.86升至87.70。

AI-generated editorial illustration: HiRAE: Hierarchical Representation Autoencoding with Residual Budgets

深度剖析

HiRAE把编码器层级融合从“人工选层或分阶段优化”改为“全层级可学习融合加深度相关残差预算”:24层按0–7、8–15、16–23分为三组,每组学习对最深特征的残差修正,范数上限分别为0.025、0.075、0.150,并配以0.50、0.25、0.10的残差dropout,总修正由三角不等式约束在0.250以内。 此前RAEv2用固定聚合选定的7层,DRoRAE需要先训练融合再适配解码器,DecQ依赖额外细节查询token;HiRAE在同一潜变量形状下学习全部24层的空间变化贡献,并取消单独的融合适配阶段。 论文给出完整架构与训练配置(DINOv3 ViT-L/16、ViT-XL解码器、Stage 1共16个epoch、Stage 2共80个epoch),并附消融:去掉残差正则后rFID可低至0.023,但引导gFID在20个epoch时升至7.905、达14.722,说明预算约束是重建与生成兼顾的关键。

在ImageNet-256上,HiRAE-24在保持潜变量token数与通道维度不变的情况下把重建FID从RAEv2的0.299降到0.209(约30%),匹配的5000张图像子集上PSNR从22.667升至26.377 dB、LPIPS从0.074降至0.043,Sobel与Laplacian误差也更低。 改进发生在与RAEv2相同的冻结DINOv3-L编码器和相同潜变量形状下,因此增益来自融合方式而非更大的潜空间或更强的编码器。 重建指标基于ImageNet验证集与固定的5000张匹配图像队列,并按原始图像纹理强度分成四个四分位,各层均显示LPIPS下降(绝对增益从0.022升至0.039)。

重建提升并未牺牲生成:80个epoch生成器训练后,HiRAE-24引导gFID为1.038、IS为257.823,优于RAEv2的1.060与255.300;无引导gFID为2.129,优于RAEv2 K=23的3.010但高于RAEv2的1.650。 论文用同一生成器训练与评测协议比较,并指出重建保真度本身不足以挑选融合方法:适配到RAEv2的DRoRAE式全深度融合rFID更低(0.065对0.209),但引导gFID更差(1.551对1.038)。 生成指标基于每配置5万张类别条件ImageNet-256样本、100步Euler ODE与epoch-80 EMA生成器,并报告了六种表示空间聚合的FDr(1.856对RAEv2的2.170)。

文本到图像任务上,HiRAE-7与HiRAE-24在预训练和监督微调后均超过RAEv2:预训练阶段HiRAE-24的GenEval提升4.52分、DPG-Bench提升1.51分;微调后GenEval从84.86升至87.70(+2.84),DPG-Bench提升1.45分,GenAI-Bench提升0.97分。 这把可学习全层级融合的证据从类别条件生成扩展到文本条件生成,并表明无需事先挑选层子集即可使用全深度配置。 评测在冻结tokenizer、统一CFG=6与相同采样协议下进行,GenEval 553张、DPG-Bench 1065张、GenAI-Bench 1600张图像,且HiRAE-7在每一项可用基准上也超过RAEv2。

启示与展望

该工作面向以冻结预训练视觉编码器为基础的表示自编码与潜空间扩散生成:适用于希望在不改变潜变量token数与通道维度、不手工挑选层子集的前提下提升重建保真度并保持生成质量的场景,包括类别条件ImageNet-256生成与文本到图像生成。方法在DINOv3-L的24层上验证,并给出HiRAE-7这一在既有7层子集上的紧凑版本,便于在已有层子集配置中复用。分析部分(类别邻域、空间有效秩、解码敏感度、生成器预测误差)为理解“为何重建提升不必然损害生成”提供了可复用的诊断视角。

深度分组数、范数上限与dropout取值来自特定配置下的消融(三组在引导gFID上最优,两组重建略好),在其他编码器深度或潜变量形状下如何映射仍需验证。潜空间分析中的类别邻域比例会随坐标标准化方式变化(共享锚点标准化下RAEv2由74.454%变为66.024%,HiRAE-24由79.536%变为81.466%),因此相关结论依赖所采用的坐标约定。解码敏感度与生成器预测误差是在固定检查点与特定扰动方向下测得,属于诊断性证据。文本到图像评测使用各基准的既定评分器与采样协议,不同评分器或提示集下的表现仍待观察。

来源