OX-NeRF 在四至十个投影的超稀疏 X 射线场景中取得最高三维重建精度
核心概要
作者提出 OX-NeRF,将跨场景卷积编码器与每个场景独立的多分辨率哈希网格融合后送入 MLP,以自监督方式联合优化,在平行束与锥束 X 射线数据集上,于四至十个投影的超稀疏条件下取得比现有自监督辐射场方法更高的三维重建精度。
Figure 1 : Overview of the OX-NeRF pipeline. Left: each scene is recorded by a few X-ray projections at known angles, and a batch of rays is drawn from them by the rule of Section 4.2 . Centre: the scene manager activates the hash grid of the current scene, so the hash encoder reads only that scene’s table, while the shared convolutional encoder reads a pixel-aligned descriptor from the source projections; the fusion module combines the two and a fully fused head returns an attenuation value. Right: attenuation is accumulated along the ray by Eq. 3 and compared with the measurement by mean squared error. Only the hash grids are specific to a scene.
arXiv深度剖析
OX-NeRF 把可迁移先验与场景专属几何分开存储:共享的 ResNet-34 卷积编码器学习整组场景共有的特征,每个场景另有自己的多分辨率哈希网格保存细节,两者拼接后由融合模块映射并送入 MLP 预测衰减。 此前的 ONIX 把先验完全放在共享权重中,限制了任一单场景可用的容量;OX-NeRF 让共享先验与场景专属表示分别存储和更新,因此单场景细节不再与共享容量竞争。 消融实验(Ellipsoids,六个训练视角)显示卷积编码器与哈希网格的组合大幅优于任一单独的点编码器,哈希网格在除一种配置外的所有配置中优于 NeRF 的固定正弦位置编码。
训练采用残差引导的射线采样:每个目标投影缓存渲染与实测像素的绝对误差图,射线按误差分布优先抽取,并保留一部分均匀采样预算,误差图按固定循环顺序定期刷新。 与按 Sobel 图像梯度一次性打分的梯度引导采样相比,残差规则跟随模型当前误差的移动,而不是持续把射线送到已经重建好的边缘。 消融中残差引导采样在每一种配置下都提升三维 SSIM,且对无编码器约束的哈希网格提升最大。
在四个数据集(Ellipsoids、Shells、Lung CT、Voids)上,OX-NeRF 在表 2 的十二个设置中有十一个渲染出最忠实的留出投影,并在每个设置中取得最高三维 SSIM、在除一个之外的所有设置中取得最高三维 PSNR。 此前适配 X 射线的辐射场方法多为单场景拟合,且未在超稀疏区间评估;OX-NeRF 在四至十个投影的每个投影数上都与现有自监督方法直接比较。 所有方法使用同一套指标定义与同一最小二乘增益校正,ONIX 与 OX-NeRF 均使用 50 个场景训练并给定相同的四个源投影,其余方法按各自发表默认设置训练。
视角数增加后优势收窄:在 Lung CT 上,OX-NeRF 在 15 个视角仍领先 R2-Gaussian,20 个视角两者相当,25 个视角时 R2-Gaussian 已明显反超。 这界定了方法的适用范围——卷积编码器提供的角度间先验,其价值随角度间隔缩小而下降,而 R2-Gaussian 把算力用于渲染更多射线,在视角增多时更有利。 表 4 给出 15、20、25 视角下两种方法的三维 PSNR 与三维 SSIM 对照。
启示与展望
该结果面向十个投影以内的超稀疏区间,适用于在同一采集设置下记录的一组关联场景,平行束与锥束几何均可使用同一渲染器。方法的价值在于共享先验补偿缺失的角度覆盖,因此最适用于角度间隔大、单场景投影不足以确定解的情形。作者指出,把输入从场景集合改为按时间排序的序列,形式化描述无需其他改动,这为同步辐射与自由电子激光的 X 射线多投影成像(每帧仅若干投影、千赫兹至兆赫兹帧率)提供了自然的扩展路径;序列还可能提供时间正则化,因为某一帧中模糊的几何可在另一帧中随物体运动而变得可解。消融显示场景数与哈希表规模都提升重建质量且都受显存限制,因此更大显存是否继续带来增益是开放问题;共享组件原则上也可承载解剖结构等特定领域先验。
读者仍需留意几点。表 1 与表 3 中的若干超参数数值在正文中未完整给出,因此复现时需参照补充材料。消融显示 50 个场景与默认哈希表规模并非最强设置,而是显存权衡下可用的最大配置,Lung CT 是限制因素,训练峰值显存已超过 90 GB,因此质量上限与硬件规模绑定。ONIX 与 CombiNeRF 在比较前经过修改(前者扩展支持锥束几何,后者替换为 X 射线透射渲染器),这些改动对各自结果的影响未在正文中量化。此外,二维投影与三维体数据两个任务的表现并不一致:十个视角时多数方法的二维 SSIM 已很高且接近,而三维重建的差距仍然明显,说明渲染保真度不能替代体积正确性。
