VolCo 用体积接触表示与体积级潜扩散生成更紧、穿透更浅的人手抓取
核心概要
作者提出 VolCo——把物体表面采样点扩展为局部三维体积网格、在每个网格点编码接触似然与连续表面嵌入(CSE)对应关系的分层接触表示,并据此构建 VolCoDiff:用 VolumeVAE 建模局部可行手部构型、用先验引导的潜扩散建模全局手部几何,在 GRAB 与 HO3D 上取得最低穿透深度与最高稳定性,生成更紧、接触面积更大的抓取。
Figure 1 : 3D contact volumes vs. 2D contact maps. Previous contact maps query points only on object surfaces, which can retain only a small fraction of hand surface. Thus it requires nearest-neighbor (NN) queries to avoid penetrations, which can easily stick in local minima. Contact volumes, however, sample points around the object surfaces and is able to retain the whole local hand configuration in the volume. Consequently, contact volumes can deterministically and precisely reconstruct local hand part and guide the pose fitting without instable penetration losses.
arXiv深度剖析
VolCo 把接触从物体表面扩展到表面周围的局部体积网格,每个网格点同时编码接触似然与 4 维 CSE 对应向量,并可按式(3)确定性地反推手部顶点位置。 此前的接触表示(逐点似然、部位/锚点标签、表面接触图)都局限在物体表面,缺少对穿透深度的显式建模,只能靠最近邻查询的手工规则恢复细节;VolCo 让接触点散布在表面周围,从而覆盖更大的手部区域并保留精确穿透深度。 在 GRAB 测试集上做接触重建对比:相同点数下从表面接触图切换到体积表示使 EPE 降低 40.1%,采用 CSE 对应的 Normal 配置达到 EPE 6.33、F@5 0.752、F@15 0.971、AUC 0.875,优于 ContactOpt、ContactGen 与 ManiDext。
VolCoDiff 按 VolCo 的层级结构分工:VolumeVAE 以局部物体 SDF 为条件把每个体积压缩为 128 维潜码,建模局部可行手部构型;基于 Scene Diffuser 的潜扩散模型建模体积潜码的组合,即全局手部先验。 以往潜扩散抓取方法只关注全局手姿而忽略接触细节,或先恢复接触再拟合手部、依赖不可微的最近邻穿透损失并易陷入局部极小;这里把局部细节与全局组合解耦,使扩散模型只需处理压缩后的体积潜码。 消融实验显示,从逐点接触图换成 VolCo 后模拟位移由 1.72 降至 1.28;加入手部先验引导后穿透深度由 0.42 降至 0.23、接触面积由 19.5 升至 26.5;再加入初始化后模拟位移降至 0.78、接触面积升至 28.5。
由于 VolCo 联合编码 SDF 与接触似然,接触力可通过线性弹簧-阻尼模型显式推断,从而施加力感知的稳定性损失,并用松弛变量放宽对穿透深度的约束。 该稳定性损失在既有力感知公式基础上引入松弛变量,使运动捕捉数据中不可避免的穿透深度随机误差不被当作错误惩罚。 消融中稳定性损失仅在存在先验引导时才明显降低位移(1.63 降至 1.10),作者据此指出几何合理性是物理稳定性的前提。
在 GRAB 与 HO3D 两个数据集上,该方法在稳定性、穿透深度与接触面积上均优于对比方法,并在批量推理时计算量随样本数增长更平缓。 在域内 GRAB 上模拟位移、穿透深度、接触面积分别超过此前最优 14.8%、32.5%、1.6%;在域外 HO3D 上分别超过 12.3%、28.5%、18.2%,显示对未见物体的泛化。 结果带 1-sigma 误差棒;参数量 74.04M、峰值内存 358.1M 高于逐点接触基线(24.41M、191.4M),但 TFLOPs 更低(2.01 对 13.2),样本数从 1 增至 10 时推理时间仅由 5.28 变为 5.47 秒,而基线由 2.90 增至 19.57 秒。
启示与展望
该工作面向给定物体模板的人手抓取合成,适用于以 MANO 为手部表示、以 GRAB 类运动捕捉数据为训练来源的设定,作者报告体积大致覆盖 YCB 基准中的物体。其价值在于把训练数据中的细粒度接触细节尽量保留到生成结果中,从而减少严重穿透并提升几何合理性,可用于改善 AR/VR 体验与灵巧机器人部署。作者也指出方法目前偏好更紧的抓取,固定体积数量与尺度限制了物体尺度的覆盖范围,后续工作将探索控制 VolumeVAE 潜码以及自适应体积数量与尺度。
正文表格中的数值在所提供的文本中未完整呈现,因此各方法在 GRAB 与 HO3D 上的具体 SD、PD、IV、CA 数值只能依据正文叙述的百分比改进来理解,无法逐项核对。稳定性损失中松弛变量的上限、体积半尺寸与网格分辨率的默认取值、以及 VolumeVAE 潜码维度等关键超参数在正文中以符号或占位形式出现,需查阅附录与代码确认。此外,接触面积指标依赖距离阈值与法向相反判据,其取值对 CA 比较的影响值得读者留意。
