arXiv 2026年9月25日作者提出 IOSVLM——一个以点云表示口内扫描(IOS)、采用 3D 编码器-投影器-LLM 架构的端到端三维视觉语言模型,并构建 IOSVQA 数据集(19,002 例、249,055 条 VQA、23 种口腔疾病、单牙弓与咬合遮挡牙弓两类扫描),配合几何到色彩代理(GCP)与两阶段课程训练,在 IOSVQA 上取得 77.23% 宏准确率与 50.39% 宏 F1,优于包括 GPT-5 与 Gemini 3 Pro 在内的多类基线。作者提出 IOSVLM——一个以点云表示口内扫描(IOS)、采用 3D 编码器-投影器-LLM 架构的端到端三维视觉语言模型,并构建 IOSVQA 数据集(19,002 例、249,055 条 VQA、23 种口腔疾病、单牙弓与咬合遮挡牙弓两类扫描),配合几何到色彩代理(GCP)与两阶段课程训练,在 IOSVQA 上取得 77.23% 宏准确率与 50.39% 宏 F1,优于包括 GPT-5 与 Gemini 3 Pro 在内的多类基线。IOSVLM 直接以原生 3D 口内扫描点云做多病种诊断,宏准确率 77.23%,比 Gemini 3 Pro 高 9.58 个百分点作者提出 IOSVLM——一个以点云表示口内扫描(IOS)、采用 3D 编码器-投影器-LLM 架构的端到端三维视觉语言模型,并构建 IOSVQA 数据集(19,002 例、249,055 条 VQA、23 种口腔疾病、单牙弓与咬合遮挡牙弓两类扫描),配合几何到色彩代理(GCP)与两阶段课程训练,在 IOSVQA 上取得 77.23% 宏准确率与 50.39% 宏 F1,优于包括 GPT-5 与 Gemini 3 Pro 在内的多类基线。作者提出 IOSVLM——一个以点云表示口内扫描(IOS)、采用 3D 编码器-投影器-LLM 架构的端到端三维视觉语言模型,并构建 IOSVQA 数据集(19,002 例、249,055 条 VQA、23 种口腔疾病、单牙弓与咬合遮挡牙弓两类扫描),配合几何到色彩代理(GCP)与两阶段课程训练,在 IOSVQA 上取得 77.23% 宏准确率与 50.39% 宏 F1,优于包括 GPT-5 与 Gemini 3 Pro 在内的多类基线。