UltraTex 用背景令牌丢弃与块稀疏注意力把多视图扩散推到 2048 分辨率,训练提速最高 91.1 倍
核心概要
UltraTex 是一个端到端多视图扩散框架,通过背景令牌丢弃、块稀疏注意力和前景感知 VAE 解码,把图像引导的 3D 纹理生成从 512/768 分辨率扩展到 2048 分辨率,并构建了覆盖超过 268,000 个 3D 资产的 G-buffer TexVerse 数据集,在数据集常见前景比例区间(10%–30%)内实现 20.6–91.1 倍训练加速和 22.3–74.6 倍端到端推理加速。
深度剖析
UltraTex 把多视图扩散纹理生成的分辨率提升到 2048,生成保留更多高频细节的纹理。 此前多视图扩散纹理方法通常受限于 512 或 768 等低分辨率,难以保留高分辨率参考图中的高频细节;该工作把统一多视图序列从超过 212K 令牌的规模压缩后完成 2K 生成。 论文在 TexVerse 留出的 100 个未见对象测试集上,于 Unshaded、Shaded、Relighting 三条评测轨道上报告 FID、CLIP-FID、CMMD、CLIP-I、LPIPS,UltraTex 在多数指标上取得最优,例如 Unshaded 轨道 FID 125.13、LPIPS 0.082。
背景令牌丢弃利用几何前景掩码在进入 DiT 之前删除背景令牌,从根本上缩短每个 DiT 块处理的序列。 已有高效多视图方法主要在注意力模块内部做跨视图稀疏或令牌压缩,而该工作把令牌丢弃放在 MM-DiT 主干之前,并保留每个保留令牌的原始 RoPE 索引以维持空间布局。 论文报告特定视图的有效前景像素仅占 7.9% 到 24.9%,并给出单卡 H200 上按前景比例扫描的绝对耗时表,显示 BTD 单独带来约 1.0–52.98 倍训练加速。
块稀疏注意力在压缩后的前景序列上进一步减少注意力计算,与背景令牌丢弃互补。 该工作先用带背景令牌丢弃的低分辨率全注意力模型分析注意力图,观察到双流块和单流块均呈稀疏模式,再以 Top-K 块选择在保留的前景序列上做稀疏注意力。 论文报告 BSA 在 BTD 之后贡献约 1.55–4.07 倍训练加速,并随前景比例升高而增大;最终模型采用保留比例 20%,因为更小的保留比例会带来可见纹理退化。
前景感知 VAE 解码用规范背景潜变量替换噪声背景并以前景受限目标微调解码器,使仅前景去噪不产生重建伪影。 仅前景去噪会让背景停留在初始高斯噪声状态,直接送入标准 VAE 解码器会造成前景质量下降;该工作把背景替换为纯黑图像编码得到的分布内潜变量,并只在前景像素上监督解码器。 论文报告重建对比:FLUX VAE 全图 PSNR 47.65、SSIM 0.9937、LPIPS 0.0023,噪声背景 PSNR 29.66,未微调 PSNR 37.81,微调后 PSNR 50.26、SSIM 0.9956、LPIPS 0.0038。
启示与展望
该结果面向具备几何条件(六视图法线图)和参考图像的对象中心 3D 纹理生成场景,训练与评测均在 G-buffer TexVerse 的六视图规范相机配置下进行,渲染分辨率最高到 2K。它使高分辨率、细节丰富的纹理生成在单卡 H200 上变得可行,并支持测试时前景缩放来增加生成视图中的有效前景面积,从而为后续 3D 纹理化提供更多纹理证据。数据集还额外提供 36 视图球面配置,可用于新视图合成、稀疏与稠密视图重建、PBR 材质估计以及纹理烘焙或重投影等任务。
论文指出方法在高度重复纹理图案的对象上可能表现不佳,且整体受限于所依赖的 FLUX 模型:VAE 潜空间压缩可能模糊渲染真值中的部分高频细节,而 FLUX 的有效工作范围更接近 1K–2K,扩展到 4K 或 8K 可能需要重新设计原生支持超高分辨率输入的 DiT–VAE 基础模型。此外,正文中若干加速倍数与数据集比例的具体数值在加载文本中以占位形式出现,补充材料中的表格给出了按前景比例分档的完整数值,读者若需精确数字应以补充材料为准。
