OpenTumorBoard 用 611 例真实肿瘤委员会病例评测 14 个模型,最佳模型与真实结论对齐仅 2.78/5
核心概要
研究者从 YouTube 上 219 场、共 12,534 分钟的肿瘤委员会录像中整理出 OpenTumorBoard 基准,包含 611 例患者病例、19,157 轮讨论和十个专科角色,并据此设置“专科单轮回答”与“整场委员会模拟”两项任务,评测 14 个通用与医学大模型后发现最佳模型在临床等价性上仅得 3.43/5、在与真实委员会结论的对齐上仅得 2.78/5,而对 Qwen2.5-VL-3B 做监督微调加强化学习可把对齐分从 1.58 提升到 1.86。
深度剖析
论文构建了以真实肿瘤委员会录像为基础的基准 OpenTumorBoard,含 611 例患者病例、19,157 轮讨论、十个专科角色,来自 219 场会议共 12,534 分钟录像,覆盖 17 个癌种、9 类专科发言类型和 11 种输入模态。 论文在表 1 中把既有基准(如 MedQA、CRAFT-MD、AgentClinic、MTBBench 等)逐项对照,指出它们缺少真实委员会病例、多学科团队、真实讨论轨迹或多模态数据,并称 OpenTumorBoard 是首个提供完整肿瘤委员会讨论轨迹并配以实际临床共识的基准;相较 MTBBench 的 66 例病例,本基准规模明显更大。 规模与结构由论文正文与附录给出;三位肿瘤学 M.D. 专家复核随机子集(15 例,每例两位评审,分歧由第三位专家裁定),病例覆盖度、病例事实性与共识保真度均获 100% “High”,回答正确性 92.6%、讨论支持度 94.4% 获 “High”。
论文把肿瘤委员会拆成两项评测任务:专科单轮(模型扮演某专科回答会议中真实提出的问题,共 4,844 个测试项、9 个类别)与整场委员会模拟(仅给病例摘要与幻灯片,要求模型生成来回讨论并给出治疗推荐、手术方案、下一步行动与临床试验匹配的共识结论)。 论文强调参考标准不是事后根据病例描述编写的,而是来自录像中观察到的专科回答与委员会共识,并称这是首次捕捉真实会议中自然出现的问题需求。 任务定义、测试集规模(66 段录像、184 例病例、4,844 个问题)与评测协议在正文第 2.4 节给出;评判使用 Qwen3.8-27B 作为 LLM 评委,配合临床等价性量表与结论对齐量表,并另报 ROUGE-L 与 BERTScore。
评测显示模型能力存在明显缺口:专科单轮中最佳模型 DeepSeek-V4-Pro(推理模式)临床等价性仅 3.43/5,关键错误率区间为 5.6%–43.5%、无支撑主张率区间为 10.0%–74.5%;整场模拟中最佳模型 Gemini 3.7 Flash 的结论对齐仅 2.78/5。 论文指出医学专用模型并未优于通用模型,四个医学模型中三个排名靠后,HuatuoGPT-3-32B 与 MedReason-8B 的无支撑主张率最高(74.5% 与 51.9%),并据此认为专科问题需要针对病例的推理而非通用医学知识。 结果来自 9 个模型(专科单轮)与 14 个模型(整场模拟)的评测,逐项分数列于附录表 A2 至 A5;论文还报告讨论轨迹越长与结论对齐越高相关。
论文把该基准同时当作训练场:用 366 个训练病例对 Qwen2.5-VL-3B 做监督微调,结论对齐从 1.58 升至 1.67,再用 Dr.GRPO 做强化学习进一步升至 1.86,论文称相对提升约 18%,并称缩小了与 MedGemma 27B 差距的一半。 论文称这显示真实讨论轨迹可以直接作为监督信号,教小模型生成互补的专科视角并收敛到委员会级决策,且强化学习无需额外标注样本。 训练设置(50 轮微调、学习率、批大小、128,000 token 上下文、固定随机种子;RL 每步 4 例、每例 16 个采样、第 430 步检查点)在附录 E 给出,改进由配对检验确认,逐项分数列于表 A4。
启示与展望
这项工作面向希望评测或训练多学科肿瘤决策模型的研究者与开发者:基准提供病例摘要、幻灯片、讨论轨迹与委员会共识,可用于单轮专科回答与整场会议模拟两类任务,并可作为监督信号做微调与强化学习。论文称将发布 OpenTumorBoard 与自动化整理流水线,使基准能随新发布的会议录像扩展,并支持在符合隐私与治理要求下向机构数据本地化延伸。结果适用于公开录像所反映的肿瘤委员会场景,尤其是晚期与转移性病例占比较高的讨论。
论文明确把 LLM 评委与临床医生评分之间的一致性列为后续工作,因此当前分数反映的是量表化自动评判下的表现。数据仅来自公开 YouTube 录像,论文指出这可能限制代表性;同时论文说明除源录像已有的隐私保护外,未做独立的患者身份筛查。整理流水线依赖 GPT-5.4 完成角色推断、分段、证据与结论抽取等步骤,论文以人工抽检与专家复核来支撑质量,但抽检规模有限(如 15 段录像、15 例病例)。此外,本证据包为全文,但部分附录(如评委提示词与量表原文、完整奖励公式)以引用形式给出而未展开,若需复现具体评分细节仍需查阅原文附录。
