跳到主要内容
返回时间线
arXiv来源发表:

TomoTransformer 用反投影空间把 CT 稀疏视角重建变成单一免重训基础模型

相关研究与后续进展

核心概要

作者提出 TomoTransformer,一种把每个局部滤波投影当作独立 token、在反投影空间中用自注意力预测缺失视角的 transformer 架构,从而用单一模型处理任意数量、任意角度和任意探测器尺寸的输入投影并查询任意目标角度而无需重训;在大规模医学 CT 解剖与自然图像数据上训练后,该模型在多个稀疏视角基准上显著优于 ViewTrans 等多用途模型、达到或超过强协议专用基线,并在 X 射线同步辐射采集的真实纳米级脑数据上展现稳健零样本泛化。

Source-provided article image: TomoTransformer: Towards a Foundation Model for CT Reconstruction
Figure 1 ·

Figure 1 : TomoTransformer operates on the disentangled filtered back-projection space by treating each local filtered projection at angle θ \theta as a token. It can process a varying number of projections in the input and generate an arbitrary number of local projections.

arXiv

深度剖析

提出以局部滤波投影为 token、在反投影空间中用自注意力预测缺失视角的 transformer 架构,使视角插值在几何上良定且对探测器尺寸不变。 相对把 FBP 图像或 sinogram 映射到干净重建的传统监督模型,该设计把重建问题重新表述为视角插值,从而摆脱对固定投影数量、角度与探测器分辨率的绑定。 摘要给出架构层面的设计说明与几何论证(“separates projections across spatial locations, making view interpolation geometrically well-posed and invariant to detector size”),属于方法性论证而非消融数据。

单一基础模型可处理任意数量输入投影、任意角度位置与探测器尺寸,并查询任意数量目标角度,无需重训。 传统模型在投影数量与角度、探测器分辨率或数据分布变化时都需要重训,该工作把这种协议依赖性替换为对输入输出投影数量的完全不可知。 摘要以“without retraining”和“fully agnostic to the number of input and target projections”直接陈述该能力,未给出具体投影数量或角度范围的数值。

在覆盖多种医学 CT 解剖与自然图像的大规模数据集上训练后,模型跨解剖、材料与分辨率泛化,并在多个稀疏视角基准上显著优于 ViewTrans 等多用途模型,达到或超过强协议专用基线。 相对并发多用途模型与协议专用基线,该工作同时追求跨协议通用性与竞争性重建质量,而非只针对单一稀疏视角协议调优。 摘要称“Extensive evaluations on several benchmark sparse-view datasets”,并给出与 ViewTrans 及协议专用基线的比较结论,但未在摘要中列出具体数据集名称、指标数值或样本量。

在 X 射线同步辐射采集的真实纳米级脑数据上展现稳健零样本泛化。 相对仅在基准数据集上评估的重建模型,该结果把验证推进到真实实验采集的纳米尺度数据,指向实际部署场景。 摘要以“robust zero-shot generalization on real experimental nanoscale brain data collected from an X-ray synchrotron”陈述,属于真实数据上的定性/定量结论,摘要未给出具体误差指标。

启示与展望

该工作面向稀疏视角断层重建场景,适用于投影数量、角度位置与探测器尺寸会变化、且希望避免按协议重训的部署环境;其宣称的适用范围包括多种医学 CT 解剖、材料与分辨率,以及 X 射线同步辐射采集的纳米级脑数据。对读者而言,这意味着可以把重建流程从“每种协议一个模型”转向“一个模型覆盖多协议”,并在真实实验数据上直接尝试零样本推理。摘要未给出具体投影数量、角度范围、探测器尺寸或目标角度数量的边界值,因此实际可用区间需以原文实验设置为准。

摘要未列出具体基准数据集名称、评价指标数值、训练数据规模与消融结果,因此“显著优于 ViewTrans”“达到或超过强协议专用基线”的幅度无法从摘要判断;零样本纳米级脑数据结果的误差水平与评估方式也未在摘要中说明。此外,摘要未交代反投影空间构造的计算开销、对投影噪声与几何标定误差的敏感性,以及在投影数量极少时的行为,这些是读者在采用前需要从原文确认的开放问题。

来源