FuseReg 用随机层子集训练解码器与 DiT,让单个解码器在完整、稀疏与单层融合下都能重建,并在生成器不变时降低 gFID
核心概要
该工作提出 FuseReg,把表征自编码器(RAE)中层融合的选择从固定启发式改为训练时对编码器层随机子集采样:在 ImageNet-256 与冻结 DINOv3-L 上,一个 FuseReg 解码器无需重训即可从完整、稀疏和单层融合重建,PSNR 高于专用于固定融合的解码器;仅替换解码器(RAEv2 DiT-XL 生成器不变)即降低无引导 gFID,联合正则化解码器与生成器在 DiT-Base 上进一步降低无引导 gFID。
深度剖析
提出层融合正则化 FuseReg:训练时对归一化的随机编码器层子集采样,使解码器与生成器不再绑定到某一个固定融合。 RAEv2 采用固定启发式层融合(对最后若干层求和),DRoRAE 与注意力多层探针学习确定性的融合权重;FuseReg 不寻找更好的单一融合,而是让下游模型在一族融合配置上都保持有效。 论文给出方法构造与理论分析,并在 ImageNet-256、冻结 DINOv3-L、候选 23 层上做受控实验;解码器变体在架构、参数量、优化超参与训练步数上匹配。
理论上证明归一化随机子集采样保持全层均值不变,并把跨层分歧转化为显式正则项,且与任何确定性全局融合存在二阶分离。 作者把固定子集与可学习全局门控统一写成融合权重形式,指出其共同局限;随后证明子集采样在层对比方向上引入变化,其权重矩无法被确定性全局融合匹配。 均值保持、协方差恒等式与全支撑界不依赖线性假设;目标分解与闭式最优解假设齐次线性预测器与平方损失,作者明确说明这是机制层面的直觉而非对非线性模型的定量预测。
一个 FuseReg 解码器在完整、稀疏与单层三种融合下都能重建,而固定融合的 RAEv2 解码器在非训练融合上明显退化。 固定融合解码器只在其训练融合上表现好:RAEv2K=23 在自身融合上达到 27.04 dB、rFID 0.18,但在其他融合上降到 12.51–14.31 dB;FuseReg(p=.95)在三种融合上为 23.77、27.52、25.13 dB,rFID 均低于 0.61。 Table 1 在 50k 图像上报告 PSNR、SSIM、rFID,并标注每行的训练支持;补充材料给出逐层与子集诊断(留一敏感性、Shapley 排序、边际增益)。
仅替换解码器、保持生成器与采样隐变量不变即可改善生成;联合正则化两阶段在 DiT-Base 上取得超出单轴增益之和的结果。 在原生融合上把普通 RAEv2 解码器换成 FuseReg 解码器,无引导 gFID 从 3.01 降到 2.21;在偏移融合上从 27.73 降到 1.92。DiT-Base 上解码器单独正则化从 17.28 到 12.37、生成器单独正则化到 13.52,联合达到 12.09。 解码器替换实验固定 DiT、融合空间、引导设置与采样隐变量;DiT 网格在 DiT-Base 与 DiT-XL 各自尺度内施加相同控制,40 个训练轮次,报告为点估计。
启示与展望
该结果面向使用冻结视觉编码器与学习式解码器的表征自编码器流程,实验设定为 ImageNet-256、DINOv3-L 的 23 个候选层以及 DiT-Base 与 DiT-XL 生成器,训练预算受控。它使一个解码器无需为每种融合重训即可服务完整、稀疏与单层融合,并让生成阶段在采样隐变量不变时受益于更好的读出;对希望在不改动预训练编码器的前提下改进解码器—生成器接口的研究者与工程实践者,这提供了一条可直接套用的训练原则。两个丢弃率需要分别选择,作者也据此建议在新设定中分别标定。
理论分解假设齐次线性预测器与平方损失,作者说明其作用是识别子集采样诱导的训练信号,而非替代非线性实验;非线性解码器与 DiT 上的重建与生成收益由实验确立。解码器与生成器对正则化的响应不同,偏好速率随模型尺度、评价指标与引导设置变化,DiT-XL 上生成器单独正则化对 gFID 未带来改善而联合正则化才解锁增益,IS 的偏好又与 gFID 不同。引导设置下全预测器与 REPA 预测器的响应存在交叉项,降低单一预测器的敏感度并不决定引导组合的敏感度。此外,迁移到其他编码器层级、分辨率、数据域与更长训练日程仍是开放问题。
