EagleDepth用像素扩散解码器在4K分辨率下实现更快更细的单目深度估计
相关研究与后续进展核心概要
EagleDepth把深度适配的潜空间扩散与像素空间生成结合:先用配对RGB-深度数据微调FLUX.2-klein-4B,在约512像素的低分辨率RGB上预测粗略深度潜码,再冻结该分支并微调预训练像素扩散解码器PiD,以原始高分辨率RGB为输入状态、以粗略深度潜码为条件,单步直接生成目标分辨率深度图,从而绕开VAE解码器;在五个常用深度数据集与Synth4K上取得有竞争力的整体精度,并在Synth4K全部五个子集的高频掩码指标与边界F1上领先,同时在4K推理中为所评估方法中最快。
Figure 1: EagleDepth excels at predicting fine-grained depth maps from high-resolution images. Compared with state-of-the-art methods, our model achieves better depth estimation results with faster inference, as shown in the radar chart (quality metrics averaged over the five Synth4K ( Yu et al., 2026a ) subsets; larger radii indicate better performance)
arXiv深度剖析
提出EagleDepth,将深度适配的潜空间扩散先验与像素空间生成分离:潜分支在低分辨率提供场景级几何引导,像素分支在目标分辨率直接生成深度。 此前生成式深度方法依赖潜空间建模与VAE重建,潜压缩会模糊窄结构与相近边界,且VAE解码随分辨率上升带来显著开销;该工作保留潜先验但不再让潜主干在输出分辨率上运行,也不使用其VAE解码器。 论文给出完整框架描述与顺序训练流程:先以rank-256 LoRA在536K RGB-深度对上微调FLUX.2-klein-4B共30,000步,再冻结该分支并全量微调PiD 50,000步,混合分辨率续训20,000步,训练使用8块NVIDIA GPU、AdamW与总批量16。
证明来自降采样RGB的深度感知特征可以引导更高分辨率的深度生成,且像素扩散解码在不同潜先验上都能提升细节恢复。 消融中把Lotus-2与两个Flux.2-depth变体分别单独预测与接上适配后的PiD解码器比较,PiD在四个数据集上降低整体AbsRel,并在Synth4K-1/2上改善两项高频指标;其中像素空间监督的Flux.2-depth在像素解码后取得最低整体AbsRel与最佳高频指标。 该结论由跨三种潜先验的解码消融支持,属于受控比较;论文同时报告潜模型始终在约512像素输入下运行,其预测潜码被缩放到目标patch网格后注入PiD。
在Synth4K原生4K评测中,Ours (MR)在全部五个子集的高频掩码AbsRel、高频掩码δ1与边界F1上领先所有对比方法,且整体精度与Ours (1024)相当。 多数对比方法在较低分辨率训练,而该工作通过混合分辨率续训(25%批次沿用原数据设置,75%来自高分辨率数据集)把输出分辨率扩展到4K,同时保持原有能力。 证据为Synth4K五个子集的表格结果与边界F1表;例如Ours (MR)在Synth4K-1边界F1为31.1,高于表中其他方法,而Ours (1024)为22.5。五个真实基准上两变体在ETH3D与DIODE的AbsRel和δ1上优于对比方法。
引入连续性促进模块,在输出投影前把渐进式反patch化与小核卷积交错,抑制patch边界处的深度不连续。 扩散Transformer的反patch化头把每个patch token映射为像素块而不做局部空间混合,在深度突变处产生patch间隔的伪影;该模块在多个空间尺度混合隐藏特征,且每个Conv-GELU-Conv块联合初始化为恒等映射以保留预训练读出。 论文以有无该模块的对比说明无模块变体在patch尺寸间隔处出现不连续,模块通过空间特征混合抑制之;组件级效率分析显示该模块开销较小(如4K下77毫秒、14.7GB)。
启示与展望
该结果面向需要高分辨率、细粒度几何的单目深度估计场景,例如小障碍物规避与精细机器人操作,也适用于以多兆像素图像为输入的3D场景理解流程。方法在约512像素的低分辨率RGB上提取几何先验,在像素分支按目标分辨率生成深度,因此使用者可在1024分辨率模型与支持至4K的混合分辨率扩展之间按细节需求与算力选择;论文还指出patch尺寸16优先细节、patch尺寸32在保持相近整体精度下更快,适合对深度细节要求较低的应用。训练侧的顺序流程(先潜分支、后冻结潜分支微调像素分支)与混合分辨率续训策略,为在已有生成式先验上扩展输出分辨率提供了可复现的配方。
论文报告的是在统一分辨率设置下的对比,真实基准图像被缩放到约1024像素而Synth4K按原生4K评测,因此真实场景中4K级细节收益的幅度仍需在更多原生高分辨率真实数据上观察。混合分辨率续训的高分辨率流仅来自UnrealStereo4K、UrbanSyn、Spring与Rawmantic3D四个数据集,其覆盖的场景类型对更广泛环境的迁移程度值得关注。此外,潜分支在推理时固定在约512像素输入,当目标分辨率继续提高或场景包含极细结构时,低分辨率引导是否仍足以支撑细节恢复,是一个开放问题。patch尺寸与细节质量之间的权衡也提示,在延迟敏感但细节要求不高的部署中需要重新校准配置。
