跳到主要内容
返回时间线
arXiv来源发表:

Tex-Zero 仅用约1110万张2D图像训练,在真实3D资产上生成纹理并超过用3D数据训练的基线

核心概要

Tex-Zero 提出一种数据构造流程,把每张2D图像当作3D空间中的平面、再对图像块做随机旋转与聚合,从而在不使用任何真实3D资产的情况下训练原生3D纹理生成的VAE与DiT,并在真实3D资产的纹理重建与生成上取得高保真结果,在六视角与正视角评测中优于NaTex与TRELLIS.2等基线。

AI-generated editorial illustration: Does Native 3D Texture Generation Necessarily Require 3D Assets for Training?

深度剖析

论文提出并验证了一个反直觉的观察:原生3D纹理生成训练真正需要的是高质量、细粒度的颜色信息,而几何信息相对次要,可以人工构造而非取自真实3D资产。 此前原生纹理生成方法(如NaTex、TRELLIS.2等)普遍依赖大规模高质量3D资产训练,而3D资产获取长期困难;该工作首次把训练数据来源从3D资产换成2D图像。 作者在附录A中给出分析:固定平面训练会使稀疏卷积的3D核方向得不到监督,整体旋转的平面仍共面,独立旋转图像块可打破共面性,聚合则让不同朝向的面片落入同一感受野;消融表显示1块不旋转时LPIPS为0.2160、PSNR-PC为11.34,16块旋转并聚合后LPIPS降至0.0355、PSNR-PC升至28.97。

Tex-Zero VAE 只用图像构造数据训练,却能在推理时高质量重建真实3D资产,并同时高保真重建2D图像,形成2D与3D共享的隐空间。 现有3D VAE在2D图像重建上表现较差,而该VAE在2D图像重建指标上一致优于3D数据训练的同类架构与其他基线。 表1中Tex-Zero VAE-f8c16在3D资产重建上PSNR-PC为0.0154、PSNR为34.03、SSIM为42.41、LPIPS为0.987,2D图像重建PSNR为39.82、SSIM为0.956;同架构3D数据训练的VAE-f8c16对应为0.0208、36.55、44.71、0.989与36.71、0.944。

Tex-Zero DiT 同样只用图像构造数据训练,把六视角条件图像表示为3D空间中的平面并用同一个VAE编码,从而缩小表示差距,在真实3D资产上生成细粒度纹理。 以往条件图像多用DINO或独立VAE编码,存在表示差距;该工作让条件与目标纹理共享同一隐空间,并随机采样部分视角训练以增强泛化。 表2中Tex-Zero在六视角下LPIPS为0.0340、PSNR为35.68、SSIM为0.983,正视角下为0.0294、35.31、0.985,均优于NaTex(六视角0.0754、27.74、0.949)与TRELLIS.2(正视角0.1187、21.38、0.900);表5显示用Tex-Zero VAE编码条件时LPIPS为0.0481、PSNR为32.54、SSIM为0.970,优于DINO、独立VAE与3D数据共享VAE。

当真实3D资产可用时,图像构造数据仍然带来增益:2D与3D联合训练同时提升VAE重建与DiT生成。 这说明该数据构造不只是3D数据稀缺时的替代方案,也可作为已有3D数据管线的补充。 表3中VAE-f16c32在3D数据上LPIPS为0.0343、PSNR为41.84、SSIM为0.981,2D+3D联合训练后为0.0140、42.85、0.988;DiT相应从0.0302、36.23、0.980改善到0.0216、37.68、0.983。

启示与展望

该结果面向原生3D纹理生成这一任务,即在给定几何与多视角参考图像条件下直接预测3D空间中的颜色,适用于希望绕开昂贵3D资产采集、转而利用现成2D图像库来扩展训练数据的研究与工程场景。论文使用SA-1B、BLIP3o-60k与ShareGPT-4o共约1110万张图像训练,图像统一缩放至训练分辨率;VAE在内部200个真实3D资产测试集上评估,DiT在内部160个样本上评估,2D图像重建在ImageNet验证集上评估。对下游使用者而言,这意味着可以先用2D图像训练共享的2D-3D VAE与DiT,再在推理时把真实几何与多视角图像输入其中;当已有3D数据时,也可按表3的方式做2D+3D联合训练。

论文的定量结论主要建立在内部测试集(200个3D资产、160个生成样本)与ImageNet验证集之上,这些评测集与训练所用的公开图像数据之间的关系在文中未展开,读者可关注在更广泛公开基准上的表现。表1中Tex-Zero VAE-f8c16在3D资产重建的PSNR与SSIM上略低于同架构的3D数据训练版本(34.03对36.55、42.41对44.71),而PSNR-PC与LPIPS更优,不同指标间的取舍值得进一步观察。消融实验多为20K步的短程训练,更长训练下的趋势仍是开放问题。此外,DiT训练中随机采样视角子集、条件图像由点云正交渲染生成且不含光照模型,这些设定在真实拍摄图像条件下的影响也值得后续验证。

来源