MeshCarve 用空间压缩隐空间流匹配生成工匠网格,隐空间仅 0.13 token/面并在 Objaverse 上取得最低倒角距离
核心概要
MeshCarve 提出一种完全在空间压缩隐空间中运行的流匹配方法:先用 VAE 一次前向生成粗顶点占据作为锚点,再分别用顶点流和边流生成顶点位置与边连接,两个隐空间由共享分层稀疏 Transformer 骨干的 VertexVAE 与 EdgeVAE 学习,并采用空间感知压缩与顶点-链接编码;其隐空间平均仅 0.13 token/面,在 Objaverse 上取得最低倒角距离与最高法向一致性,并泛化到 Toys4K。
Figure 2: Overview of MeshCarve. Top: VertexVAE and EdgeVAE share one sparse transformer backbone, reaching the compressed 64 3 64^{3} latent through the spatial down projection of Eq. 1 and decoding the vertex voxels and their connections through the mirrored up projection. Bottom: end-to-end generation from a dense point cloud through the anchor generator and two flows.
arXiv深度剖析
MeshCarve 将顶点位置与边连接分别编码到两个独立的紧凑隐空间,避免了先前工作将几何与拓扑联合编码导致的显著重建质量下降。 LATO 与 MeshFlow 等先前方法把顶点位置和连接放在同一个隐空间中,论文指出这种联合编码会明显降低重建质量;MeshCarve 用共享同一骨干的 VertexVAE 与 EdgeVAE 分别处理两类信号。 消融实验显示,使用同一 VAE 骨干同时编码顶点位置与边连接时性能明显下降,且该退化会因顶点细分与剪枝不准确而在推理中快速累积。
论文提出分层稀疏 Transformer VAE 骨干与空间感知压缩,使 token 数量随局部顶点密度而非网格分辨率增长,从而在压缩隐空间的同时不牺牲重建质量。 先前顶点锚定设计在空间下采样时报告较大重建损失,MeshFlow 的 TokenMerge 压缩也以显著重建质量为代价;MeshCarve 改为将父体素八个子体素按通道堆叠后学习线性映射。 将空间感知压缩替换为朴素均值池化与广播后,EdgeVAE 的 F1 从 0.96965 降至 0.88111;VertexVAE 重建 F1 在 Toys4K 与 Objaverse 上分别达到 0.998 与 0.996。
论文提出顶点-链接编码,把任意连通性转化为定长、无序的逐顶点连续嵌入,从而忠实恢复复杂艺术拓扑。 既有做法把邻居坐标分配到有序槽位并填充到最大度数,对邻居排列敏感、对顶点度数设上限且为填充保留维度;顶点-链接编码用随机傅里叶特征编码相对位置并对邻居求和,无需填充、无度数上限且与顺序无关。 移除顶点-链接编码使 F1 降至 0.70793,替换为槽位式邻居编码为 0.96167,移除 RoPE 降幅最大至 0.40872;在给定参考顶点时,MeshCarve 边流在 Objaverse 上倒角与 Hausdorff 距离领先 LATO.2 拓扑流 22% 至 30%。
MeshCarve 的隐空间平均仅 0.13 token/面,为所比较方法中最短,使更大的流 Transformer 得以运行,并在 Objaverse 上取得最低倒角距离与最高法向一致性,同时泛化到 Toys4K。 先前自回归方法每面 1.0 至 9 个 token,流匹配方法每面 0.52 至 6.5 个 token;MeshCarve 以粗顶点体素为锚点并进一步空间压缩,端到端生成约 11 秒。 在 185 个留出 Objaverse 网格与 500 个 Toys4K 网格上评估,MeshCarve 在 Objaverse 上倒角距离为 .00649、法向一致性为 .8529,在 Toys4K 上倒角距离与 LATO.2 相当;顶点流与边流参数量分别为 1.27B 与 2.37B。
启示与展望
该结果面向以点云为条件、以用户给定顶点预算为控制的工匠网格生成场景,适用于 Objaverse 与 Toys4K 这类评估分布,并已在 558K 个 Objaverse 网格上训练、最大顶点数上限为 20,000。方法的价值在于把每个生成阶段都放进空间压缩隐空间,使 token 预算随网格增大仅次线性增长,从而让更大的流 Transformer 在可接受算力下运行;这为需要可编辑拓扑与高效渲染的下游任务提供了更短的生成序列。顶点预算作为条件输入,使生成可适配用户偏好;锚点生成器基于 VAE,因而也能以不同随机种子采样锚点。
读者仍需关注若干开放问题:VAE 重建接近但不精确,下游全部继承这一上限;超过 10K 顶点时量化可能降低网格质量;边流在参考顶点上教师强制训练、推理时接收生成顶点,存在域间差距,因而给定参考顶点时表现更好。此外,表面指标看不到连通性,端到端生成的非流形边比例仍高于自回归方法,论文把这一缺陷定位在边阶段所运行的顶点上。锚点生成器采用后验均值时比后验采样在 Hausdorff 距离上约好 2%、在倒角距离上约好 3% 至 4%,采样会增加锚点变化。
