CARE 多智能体对比裁决把黑色素瘤与不典型痣的零样本诊断准确率从 66.5% 提升到 77.6%,但胸部 X 光任务仍落后于 Gemini-3-Pro
核心概要
该研究在零样本、无微调、无外部工具的条件下,用两个影像学代理任务(黑色素瘤 vs 不典型痣、肺水肿 vs 肺炎)评测多模态大模型代理,并提出免训练的多智能体框架 CARE:两个疾病专属代理分别生成对立证据,第三个裁判代理基于原图核查并裁决;CARE 在皮肤镜任务上把 Gemini-3-Flash 的准确率从 66.5% 提升到 77.6%(Youden 0.552),在胸片任务上从 60.2% 提升到 64.6%,但胸片任务仍低于 Gemini-3-Pro 的 70.9%,整体水平尚不足以临床部署。
深度剖析
作者提出 CARE(Contrastive Agent REasoning),一个免训练、无需外部工具的多智能体框架:两个疾病专属代理在同一张图上分别只从各自假设出发列举视觉证据且不得下诊断,第三个裁判代理接收原图与两组证据,做图像核查、标记无支撑或矛盾主张,并权衡后给出最终诊断。 与依赖额外标注微调、重复采样一致性检验、工具调用或专门训练配方来缓解过度自信的既有做法不同,CARE 仅通过结构化提示把分歧显式组织起来,在零样本设定下即可运行。 方法在论文第 2 节完整给出,并配有图 2 的流程示意;作者说明 CARE 仅由结构化提示实现,不计算显式似然或数值函数。
在皮肤镜任务(黑色素瘤 vs 不典型痣)上,基于 Gemini-3-Flash 的 CARE 达到 77.6% 准确率、F1 0.769、Youden 0.552,相比单代理 Gemini-3-Flash 基线(66.5% 准确率、Youden 0.328)提升超过 11 个百分点。 该提升在计算量匹配的对照下依然成立:Self-Check(3×)与 Majority-Vote(3×)同样每次调用 API 三次,但增益有限,说明收益来自结构化对比推理而非单纯增加采样或集成。 数据集为 derm7pt 中筛选出的 509 例(257 例不典型痣、252 例黑色素瘤),全部仅用于评测;CARE 相对 Gemini-3-Flash 的差异在 McNemar 与置换检验下 p < 0.0001。
在胸片任务(肺水肿 vs 肺炎)上,CARE 达到 64.6% 准确率、F1 0.619、Youden 0.287,优于其基座模型 Gemini-3-Flash 的 60.2%,但仍低于 Gemini-3-Pro 的 70.9%。 这说明对比裁决的增益在两个模态上方向一致,但幅度不同;作者同时报告 CARE 与 Gemini-3-Pro 在皮肤镜任务上的差异不具统计显著性(McNemar 与置换检验 p = 0.192)。 数据集为 MIMIC-CXR 中经 XOR 与低置信表述过滤后的 1,739 例(878 例水肿、861 例肺炎);CARE 相对 Gemini-3-Flash 在 ACC、F1、Youden 三项指标上 p < 0.001。
消融实验显示,裁判代理若只能看到两个专家代理的文本论证而看不到原图(Blind-CARE),在黑色素瘤任务上准确率为 73.9%,优于两种 Self-Check 变体但低于 CARE;定性案例中 CARE 能标记矛盾发现、重新校准跨代理证据权重,并借助多视图核查否定肺炎代理的局限性实变主张。 这为“直接访问视觉证据对识别编造或误读主张是必要的”提供了实验与案例层面的支持,也提示在视觉混淆病例中错误可能彼此相关而非随机,因此简单多数投票的纠错效果有限。 消融覆盖 Self-Check(2×/3×)、Majority-Vote(3×)与 Blind-CARE 三类变体,并与 CARE 做计算量匹配比较;定性证据来自图 3 的若干代表性案例。
启示与展望
该研究面向零样本、仅影像输入、强制互斥二分类的受控代理任务,适用于希望在不做微调、不接外部工具的前提下评测或设计医学多智能体推理的研究者与工程团队;作者指出后续可探索分割模型或图像检索等外部工具是否能进一步提升表现,并建议在更严格的评测下继续验证。
标签质量存在不确定性:皮肤镜数据部分经组织学验证、其余依赖专家诊断,胸片标签由放射报告自动抽取,反映的是报告印象而非 CT 或临床裁决等独立参考标准;强制互斥设定与患者可能同时患水肿和肺炎的事实不符;代理在无外部工具条件下评测。此外,图 3 中部分案例文本在原文中以省略形式呈现,因此定性证据只能按已展示的片段理解。
