跳到主要内容
返回时间线
arXiv来源发表:

TSegAgent 用 SAM3 加几何推理实现零样本牙齿分割与 FDI 识别,在 Teeth3DS 上 mIoU 93.37、TIR=1 达 87.17%,并在私有数据集上保持泛化

核心概要

该工作提出 TSegAgent,把口内扫描三维模型的牙齿实例分割与 FDI 编号重构成零样本几何推理问题:先用多视角渲染(含曲率热图)配合 SAM3 文本提示“tooth”生成候选掩膜,再按 IoU 与包含关系合并为面级实例标签,随后由几何感知的视觉语言智能体经多轮对话完成非牙齿区域识别、中切牙定位、全牙弓分类与错误纠正;在含 1200 个三维牙齿模型的 Teeth3DS 上取得 mIoU 93.37、TLA 96.40、TSA 96.76、TIR 97.46、TIR=1 87.17,在来自合作诊所的 340 个更具缺陷与伪影的私有测试模型上取得 mIoU 82.10、TLA 96.68、TSA 95.99、TIR 85.41、TIR=1 5

Source-provided article image: TSegAgent: Zero-Shot Tooth Segmentation via Geometry-Aware Vision-Language Agents

深度剖析

提出零样本的牙齿实例分割与识别框架,从口内扫描三维模型直接输出 FDI 标签,不需要任务特定训练和密集标注。 既有方法多把牙齿分割与识别当作监督式直接预测问题,依赖 Teeth3DS 等密集标注数据训练专用三维网络;该工作改为零样本几何推理,用通用基础模型加牙科解剖先验替代学习牙科专用特征。 论文在 Teeth3DS(1200 个三维牙齿模型,逐顶点 FDI 标注)与私有数据集(340 个测试模型,扫描石膏模型、缺陷与伪影更严重)上对比 MeshSegNet、PTv3、TSGCNet、DBGANet、CrossTooth、3DTeethSAM 等方法,TSegAgent 在两项数据集上均报告最优或接近最优结果。

设计了几何感知且可解释的视觉语言智能体,融合牙弓先验、多视角视觉证据与体积信息完成牙齿分类。 相比 IOSSAM、3DTeethSAM 等 SAM 系方法仍需训练牙齿检测器或精修器,该工作把实例 ID 按拟合牙弓曲线重排,并把每颗牙有向包围盒的三维尺寸写入文本提示,让 VLM 依据牙弓对称性与尺寸对应关系判断中切牙,而非依赖图像左右像素平衡。 消融实验显示,仅分割基线 mIoU 75.21、TLA 96.45;加入 VLM 与曲率后 mIoU 升至 85.49、TIR 89.64、TIR=1 66.72;再加牙弓重排后 TIR 90.43、TIR=1 74.83;加入 OBB 体积线索后 TIR 86.36、TIR=1 71.17;完整配置 mIoU 93.37、TIR 97.46、TIR=1 87.17。

引入显式几何推理与验证机制,通过多轮对话检测并纠正识别错误,降低牙齿编号的歧义。 该工作把识别拆解为非牙齿区域识别、中切牙识别、全牙弓分类、错误检测与纠正等可解释子任务,并依据双侧对称、牙弓序列一致性与对应牙体积相似性触发自我纠正,无需外部监督或事后全局优化。 论文指出分割收益主要来自非牙齿过滤与过分割去除,错误纠正主要提升 FDI 准确率;在私有数据集上,监督方法如 3DTeethSAM 与 DBGANet 出现明显性能下降,而 TSegAgent 保持较稳的整体准确率。

在存在显著域偏移的私有数据集上展现出更强的泛化能力。 多数对比方法在 Teeth3DS 训练集上从头训练至收敛后跨域测试,性能大幅下滑;TSegAgent 因不依赖任务特定训练,在更具缺陷、干扰与伪影的扫描石膏模型上仍维持较高指标。 私有数据集上 TSegAgent 报告 mIoU 82.10、TLA 96.68、TSA 95.99、TIR 85.41、TIR=1 51.96,而 3DTeethSAM 为 mIoU 81.42、TLA 70.98、TIR 82.42、TIR=1 37.06,DBGANet 为 mIoU 41.59、TIR 61.83、TIR=1 22.06。

启示与展望

该结果面向数字牙科中的口内扫描三维模型,适用于需要牙齿实例分割与 FDI 编号的正畸诊断、治疗规划与修复设计等场景;方法以零样本方式运行,无需任务特定训练与密集标注,因此对标注预算有限或扫描来源多样的团队更具吸引力。论文称 TSegAgent 兼容多种 VLM 服务,实验中采用 ChatGPT 5.2,并已公开代码,便于在自有扫描数据上复现与扩展。作者提出未来可将该推理框架扩展到其他解剖结构,并加入更多领域先验以增强稳健性与临床适用性。

论文未报告推理时延、显存占用或单例成本等计算开销细节,也未给出多轮对话轮数的定量分析;私有数据集来自合作诊所,其采集与标注细节描述有限,跨机构复现时需自行评估域差异。消融表中部分设置缺少 TSA 或 TIR 数值,完整配置与各组件之间的交互仍有进一步刻画空间。此外,实验使用单一 VLM 服务,更换模型后的表现属于开放问题;论文将扩展到其他解剖结构列为未来工作,尚未给出该方向的验证结果。

来源