IOSVLM 直接以原生 3D 口内扫描点云做多病种诊断,宏准确率 77.23%,比 Gemini 3 Pro 高 9.58 个百分点
核心概要
作者提出 IOSVLM——一个以点云表示口内扫描(IOS)、采用 3D 编码器-投影器-LLM 架构的端到端三维视觉语言模型,并构建 IOSVQA 数据集(19,002 例、249,055 条 VQA、23 种口腔疾病、单牙弓与咬合遮挡牙弓两类扫描),配合几何到色彩代理(GCP)与两阶段课程训练,在 IOSVQA 上取得 77.23% 宏准确率与 50.39% 宏 F1,优于包括 GPT-5 与 Gemini 3 Pro 在内的多类基线。
深度剖析
构建 IOSVQA:一个多来源、支持多种扫描类型输入的大规模 IOS 诊断 VQA 数据集,覆盖 23 种口腔疾病、19,002 例与 249,055 条问答对。 此前牙科视觉语言模型工作多基于 2D 图像或由 IOS 渲染的多视角图像,缺少面向原生 3D 几何、且显式包含多病共存与异质扫描形式的大规模配对资源。 数据来自 MaloccIOS、DiseaseIOS 与公开的 Bits2Bites 三个来源;MaloccIOS 中随机抽取的 557 例由 28 名正畸医生人工校正得到 7,628 条高质量样本,其余 200,742 条含部分标签噪声;DiseaseIOS 与 Bits2Bites 分别由 5 名和 1 名正畸专家标注。
提出 IOSVLM:首个直接以原生 3D IOS 几何为输入的端到端视觉语言模型,统一完成多病种诊断与生成式 VQA。 相较将 3D 扫描渲染为多视角图像再交给 2D VLM 的做法,该模型不依赖视角选择,直接建模三维表面几何。 在 IOSVQA 测试集(5,884 个样本)上取得最高宏准确率 77.23%、宏 F1 50.39% 与召回 52.96%;相对开源 2D MLLM 至少高 16.02% 准确率/11.25% F1,相对开源 3D MLLM 至少高 34.20% 准确率/16.21% F1,相对 GPT-5 高 14.97% 准确率/5.66% F1,相对 Gemini 3 Pro 高 9.58% 准确率/1.46% F1。
提出几何到色彩代理(GCP):用表面法线构造翻转鲁棒的伪颜色通道,弥补无颜色 IOS 与依赖颜色的点云预训练之间的分布差距。 该工作把 RGB 的作用解释为局部可分性线索而非语义颜色,并用纯几何量替代这一成分,从而复用颜色预训练先验。 消融实验中,以常量白色替代 GCP 时为 67.02% 准确率/43.10% F1,启用 GCP 后提升至 72.28%/48.06%,即 +5.26% 准确率与 +4.96% F1。
采用两阶段课程训练:第一阶段训练 3D 编码器与投影器并冻结 LLM,第二阶段冻结编码器、用 LoRA 微调投影器与 LLM,并在一部分高质量样本上加入 GPT-4o 生成的思维链理由。 该策略在混合质量监督下先建立几何-语言对齐,再用高质量标注提升诊断与生成可靠性。 默认设置给出最佳整体准确率与 F1(77.23%/50.39%);理由监督使宏 F1 与仅标签微调相当,但宏解析率达到 100%,且定性观察到重复标签等退化行为减少。
启示与展望
该工作面向常规牙科场景中的口内扫描,覆盖单牙弓与咬合遮挡牙弓两类输入,目标是多病种统一诊断与可生成的自然语言问答,服务于临床记录与医患沟通。数据集整合了 MaloccIOS、DiseaseIOS 与 Bits2Bites 三个来源,并做了全局配准以统一朝向与上下颌相对位姿,因此其结论适用于这一标签体系与预处理流程下的 IOS 数据。对希望把三维表面几何纳入诊断流程的研究者与临床信息化团队而言,IOSVQA 与 IOSVLM 提供了可复用的训练与评测起点,GCP 与两阶段课程也可作为其他无颜色三维医学表面任务的参考设计。
仍待观察的问题包括:IOSVQA 中 MaloccIOS 的 200,742 条样本含部分标签噪声,其影响在文中通过课程训练加以缓解,但噪声对最终指标的具体贡献未单独量化;理由监督主要改善输出可解析性与退化行为,对宏 F1 的提升有限,其临床可用性还需在真实工作流中检验;评测集中在 IOSVQA 单一数据集与宏平均指标上,跨机构、跨扫描仪的外部验证尚未在文中呈现;GCP 目前以表面法线实例化,文中提到曲率等其他几何描述子可能同样适用,但未给出相应结果。
