OPGAgent 用多工具智能体与共识机制做全景牙片解读,在自建 OPG-Bench 上取得 42.3% 精确匹配 F1 并把每例假阳性压到 4.89
核心概要
该工作提出 OPGAgent,一个由 GPT-5.2 规划、按 ReAct 范式编排分层证据采集、专用工具箱与共识子智能体的多工具牙科智能体,并配套提出基于(位置、字段、取值)三元组、源自真实临床报告的 OPG-Bench 评测协议;在含 1,009 例匿名全景片与 5,219 条 VQA 对的 OPG-Bench 上,OPGAgent 取得 42.3% 精确匹配 F1、49.7% 综合得分、43.1% 精确率与每例 4.89 个假阳性,并在 MMOral-OPG 上以 62.53% 准确率领先。
Fig. 1. Overview of OPGAgent. The Agent orchestrates three modules: Hierarchical Evidence Gathering, Specialized Toolbox, and Consensus Subagent.
· 第 4 页深度剖析
OPGAgent 是面向全景牙片解读的多工具智能体,由分层证据采集、专用工具箱与共识子智能体三部分组成,按全局、象限、牙位三阶段逐步细化分析并把发现存入 Memory。 作者称其为首个专门为 OPG 解读设计的智能体系统,把 FDI 记法与动态 ROI 裁剪等牙科领域机制纳入智能体流程,而既有医疗智能体(MedAgents、MDAgents、MedAgent-Pro)并非为牙科细节设计。 论文给出三阶段流程、工具箱四类工具(空间、检测、效用、专家库)与共识规则(≥3 个来源一致或 ≥2 个来源报告同一发现即确认)的完整描述,并以消融实验逐项验证各模块贡献。
共识子智能体通过多来源投票与解剖学约束解决冲突:当多数投票确认某发现但来源在牙位编号或严重度上不一致时,用检测工具提供的 FDI 坐标图把发现指派到空间正确的牙位。 相对单次生成式 VLM 输出,这一机制把确定性坐标作为硬约束来纠正 VLM 的属性错误,并让规则检测器漏掉的罕见病变仍可通过 VLM 投票进入报告。 消融显示加入专家库后精确率升至 38.62%、假阳性从 6.17 降至 2.37,但召回降至 16.64%;再加入空间工具后召回回升至 35.98%、F1 达 36.55%;最后加入检测工具达到 42.30% F1 的峰值。
OPG-Bench 以(位置、字段、取值)三元组把牙科报告形式化,位置遵循 FDI(ISO 3950)记法,取值依据 ICDAS、AAP/EFP 2017、PAI 等标准把数值量表映射为语义严重度,并只记录异常发现。 作者指出既有 VQA 基准只测量被问到的问题,未覆盖的发现类型不可见、无提示区域的幻觉也无法量化;三元组协议同时审计病理发现与幻觉,并给出精确匹配与检测、定位、分级的分步部分匹配指标。 数据集含 1,009 例匿名 OPG 及配对临床与结构化报告、5,219 条无引导 VQA 对,来自多家诊所,限定 16 岁及以上患者,真值来自真实临床报告并做人工抽查。
在 OPG-Bench 与公开 MMOral-OPG 上,OPGAgent 在结构化报告与 VQA 两类评测中均优于牙科 VLM 与医疗智能体框架。 作者报告 OPGAgent 在保持较高精确率的同时显著降低假阳性,而 Gemini-3-Flash 召回更高(45.1%)但精确率降至 27.6%、每例 10.58 个假阳性;OralGPT-Omni 假阳性最低(4.02)但覆盖不足(F1 6.2%)。 对比覆盖通用 VLM、牙科 VLM 与医疗智能体;为隔离架构贡献,MedAgent-Pro 被配置为与 OPGAgent 相同的 LLM 与工具,所有模型使用相同提示(温度 0.3)并经同一 Parser Agent 结构化。
启示与展望
该结果面向全景牙片的多任务筛查与结构化报告生成场景,适用于 16 岁及以上、以恒牙列为主的患者群体,其价值在于把分散的专用模型与 VLM 专家组织成可审计的流程,并让发现以 FDI 位置、临床字段与分级取值的形式落地。对希望构建牙科或其他影像智能体的读者,可复用的是分层证据采集、工具封装与多来源共识这三层结构;对临床与评测读者,可复用的是三元组报告协议与检测、定位、分级的分步指标。作者说明代码将在接收后发布,因此当前可复现的是方法描述与评测设计。
作者指出真实报告通常优先记录主诉而非偶然发现,因此当智能体检出未记录但有效的病变时,报告的假阳性率可能被略微高估。评测中所有模型经同一 Parser Agent 结构化并做人工过滤,解析器与过滤环节对结论的影响仍值得关注。此外,牙科专用 VLM 在自建 OPG-Bench 上得分远低于通用 VLM,而在其自身的 MMOral-OPG 上表现良好,作者据此提出基于生成问答对训练的模型可能未完全覆盖真实临床报告分布,这一解释仍需更多数据验证。共识规则中“≥3 个来源一致或 ≥2 个来源报告同一发现”的具体阈值敏感性、以及不同诊所来源带来的分布差异,都是读者可继续留意的方向。
