Position Forcing 让单阶段 3D 生成从 VecSet 隐变量中恢复位置并逐级量化,在 ULIP 与 Uni3D 四项指标上取得最佳或并列最佳
核心概要
该工作观察到 VecSet 隐变量 token 仍保留可恢复的空间对应关系,提出 Position Forcing:在去噪过程中从预测的干净隐变量恢复 token 位置,并按噪声水平逐级量化后经 3D RoPE 反馈给扩散 Transformer,从而在无需单独位置生成阶段的情况下为单阶段 3D 生成提供由粗到细的空间引导,在 ULIP 与 Uni3D 四项指标上取得最佳或并列最佳。
Figure 1 : Our observation and positional conditioning designs. (I) Latents can be decoded into shape geometry and token positions. (II) (a) VecSet uses no explicit positional conditioning; (b) VoxSet and two-stage pipelines use positions established beforehand. (c) Our naive design recovers positions from the current noisy state. (d) Position Forcing recovers positions from the predicted clean state and applies progressive quantization to provide coarse-to-fine spatial guidance.
arXiv深度剖析
作者发现 VecSet 隐变量 token 与其空间查询之间保留可解码的对应关系,仅凭隐变量即可恢复查询位置。 此前单阶段 VecSet 生成模型必须在去噪中隐式推断 token 位置,而多阶段方法依赖单独的结构生成阶段提供显式位置引导;该观察说明位置信息本就存在于隐变量中。 论文以图示(Fig. 1(I))说明查询位置可从隐变量 token 单独恢复,并据此设计位置解码器;表 1 显示冻结 VAE 时位置恢复精度有限,联合微调后在 0% 噪声下达到 99.9,在 30% 噪声下仍为 67.3。
提出 Position Forcing 自条件框架,将位置量化与从预测干净隐变量恢复位置结合,提供逐步精确的空间引导。 相比从当前含噪隐变量直接预测位置并构造全分辨率位置编码的做法,该框架按噪声水平调整量化粒度,并从预测干净隐变量恢复位置。 消融(Fig. 4)显示固定分辨率 128 的配置 (b) 出现房屋周围碎片化结构与不规则角色表面,而渐进量化配置 (c) 减少这些伪影;从预测干净隐变量恢复位置的配置 (f) 相比从含噪隐变量预测的 (e) 在四项指标上均有提升(ULIP-T 0.077 对 0.058,ULIP-I 0.130 对 0.095,Uni3D-T 0.257 对 0.225,Uni3D-I 0.321 对 0.265)。
该方法沿由粗到细的空间轨迹引导生成,实现高质量单阶段 3D 生成,无需单独的位置生成阶段。 多阶段方法先由独立结构生成模型确定几何内容所在位置再生成细节,而该方法在单条去噪轨迹内持续更新空间引导。 表 3 中 Position Forcing 在 ULIP-T、ULIP-I、Uni3D-T、Uni3D-I 四项指标上取得最佳或并列最佳(0.077、0.130、0.257、0.321),优于 TRELLIS、TRELLIS 2、Direct3D-S2、Hi3DGen 等多阶段方法以及 CraftsMan 1.5、UniLat3D、Hunyuan3D 2.1 等单阶段方法;表 2 中最大隐变量配置取得最低 CD 5.39 与最高 F1 95.38。
联合微调 VAE 与位置解码器可同时支持几何重建与位置恢复,并提升下游生成质量。 仅冻结 VAE 训练位置解码器时位置预测精度有限且随噪声迅速退化,联合训练使隐表示同时具备几何与位置感知能力。 表 1 显示冻结 VAE 时位置恢复精度从 0% 噪声的 67.4 降至 30% 噪声的 6.7,联合微调后为 99.9 至 67.3;消融中配置 (g) 使用 Stage-I VAE 重训 DiT,其四项指标均低于完整配置 (f)。
启示与展望
该结果面向采用 VecSet/VoxSet 隐表示的单阶段图像条件 3D 几何生成:在此设定下,位置可从隐变量恢复并经渐进量化反馈给 DiT,从而在单条去噪轨迹内获得由粗到细的空间引导。对使用该表示、希望避免额外结构生成阶段的研究者与工程实现者,这提供了一条可直接嵌入现有扩散 Transformer 的路径;论文的推理配置为 12288 个隐变量 token、50 步 Euler 采样、CFG 尺度 5.0。
位置恢复在较高噪声水平下精度下降(表 1 中 30% 噪声时为 67.3),训练时使用真值查询位置而推理时使用预测干净隐变量,这一训练与推理的差异如何影响更极端噪声区间或更长采样轨迹,仍是可继续观察的问题。渐进量化的分辨率调度、扰动强度与参考坐标系选择对结果的具体贡献,论文以消融与图示呈现,读者若要在自有数据上复现,需要结合附录中的实现细节核对。此外,定性比较依赖图示,定量结论主要来自 ULIP 与 Uni3D 相似度指标。
