SILSA用384个滑动窗口切片潜变量做单图三维生成,PSNR提升8.7%、Betti误差降9.2%
核心概要
SILSA提出一种拓扑感知的高分辨率三维生成框架,用沿三个坐标轴的固定重叠切片潜变量替代体素token,配合SliceVAE、体素锚格与切片级持续同调监督,在单图到三维任务上把PSNR从30.12提升到32.74、覆盖率从73.12%提升到79.08%、Betti误差相对降低9.2%,同时只用384个token,训练内存降低40.4%、推理时间降低58.5%。
深度剖析
SILSA把三维形状表示为沿x、y、z三个规范轴的固定重叠切片潜变量,每个token概括一个局部深度窗口,从而在保持横截面连续性的同时把生成序列压缩到384个token。 此前的稠密体素、稀疏体素、八叉树与层级tokenizer的token数随表面面积或占据情况变化,而三平面与集合式潜变量又削弱了token与局部几何的对应;SILSA用固定长度的多轴切片布局同时保留空间锚定与有界token数。 论文报告SILSA仅用384个token,比Trellis、XCube、SparseFlex少98%以上,比次紧凑基线少70.0%;消融显示单轴变体Betti误差升至5.92至8.07,双轴为2.61至2.74,三轴为1.58。
SliceVAE用滑动窗口编码有向表面采样点、以稀疏体积累积解码,并引入切片级拓扑监督:在单个横截面内匹配持续同调图,在相邻切片间对齐Betti转移。 以往拓扑损失多用于二维分割或隐式重建,全容积持续同调监督在高分辨率生成训练中代价过高;SILSA把监督限制在切片内与切片间,使拓扑监督在生成训练中可行。 重建评测中SILSA把CD从0.61降到0.59、F-Score@0.01从96.18升到96.79、IoU从92.54升到93.01,Betti-Err从1.743降到1.582;消融显示去掉拓扑损失后Betti-Err为4.43、CD为0.78,仅用持续同调项为2.91,仅用Betti转移项为2.87。
体素锚格(VAL)在rectified-flow transformer内部提供共享三维工作空间,让三个方向的切片token按轴与深度读写对应的锚平面,把跨轴一致性变成空间化的通信机制。 多轴切片各自独立去噪时缺乏协调,直接跨轴注意力虽能改善一致性但约束较弱;VAL以带门控的读写让不同轴的证据在同一空间累积。 消融显示无跨轴通信时CD为5.87、IoU为49.26、Betti-Err为17.91;直接跨轴注意力为CD 0.60、Betti-Err 1.64;VAL为CD 0.59、Betti-Err 1.58。写入机制消融中覆盖写为CD 0.66、Betti-Err 1.91,加性写为0.63与1.74,门控写最优。
在单图到三维生成上,SILSA在FD、PSNR、覆盖率与MMD上取得最优,同时匹配最优的KD与LPIPS,并显著降低训练与推理成本。 相比SparseFlex等强基线,SILSA在几何与分布指标上更好,且用单阶段生成器取代先预测活跃体素再合成局部几何的多阶段流程。 论文报告PSNR从30.12提升到32.74(相对提升8.7%),覆盖率从73.12%提升到79.08%(绝对提升5.96点),FD为10.16、MMD为14.02;训练内存从14.6GB降到8.7GB,训练时间从0.38秒/迭代降到0.21秒/迭代,推理从0.82秒/形状降到0.34秒/形状。
启示与展望
这项工作面向从单张图像生成高分辨率三维资产,适用于内容创作、设计、教育与仿真等需要快速产出三维模型的场景,其效率优势也让算力有限的研究者更容易开展高分辨率三维生成。方法默认训练分布具有足够多样性与规模,且输入图像信息充分;论文在Trellis-500K上训练,并在200个Toys4K资产与50张真实图像上评测,另在DeepFashion3D开放曲面数据上验证了SliceVAE的泛化。对希望复现或扩展的读者,切片数、窗口宽度、VAL分辨率与拓扑损失权重都给出了可调范围与默认配置。
论文自述性能依赖训练分布的多样性与规模,分布外结构模式可能重建保真度下降,输入图像模糊或信息不足时生成质量也会受影响,扩展到更广数据源被列为未来方向。此外,拓扑指标在DeepFashion3D这类拓扑简单数据上接近饱和,说明该指标在简单形状上区分度有限。切片数增加超过默认值后CD与IoU仍有小幅改善但Betti误差回升,提示切片粒度与拓扑一致性之间存在需要进一步厘清的权衡。本证据包为全文,但图表以文本形式呈现,部分可视化细节无法从文本完全还原。
