OncoNoteBERT 用 29 万份英国门诊肿瘤笔记训练专用编码器:继续预训练困惑度降至 2.10,从零训练分词器使序列缩短约 23.6%
相关研究与后续进展核心概要
该研究基于英国某专科肿瘤中心 21,564 名肺癌与头颈癌患者的 290,026 份门诊笔记,比较 RadBERT、PathologyBERT 与两种本地策略:继续掩码语言模型预训练得到的 OncoNote-RadBERT 验证困惑度为 2.10,从零训练并配肿瘤专用 WordPiece 分词器的 OncoNoteBERT 困惑度为 2.83,但分词效率最高(子词生育率 1.224、归一化序列长度 0.7636,约少用 23.6% 词元),并在 13 个掩码探针中 12 个给出临床可接受预测(OncoNote-RadBERT 为 7 个);两个本地模型均把机构占位符 [REMOVED] 表示为单一可学习词元。
Figure 1: Study workflow for data preparation, encoder development, and intrinsic representation evaluation. All evaluations were performed on the validation split of patient data and did not alter model parameters.
arXiv深度剖析
领域相邻编码器在门诊肿瘤语言上零样本拟合很差:RadBERT 困惑度 113.04,PathologyBERT 为 2,035.03。 此前肿瘤相关 BERT 模型多面向具体下游任务,而非作为通用表示编码器;该工作把放射与病理领域编码器直接放到真实门诊肿瘤语料上做内在评估。 在留出验证集上以掩码语言建模损失与困惑度评估,RadBERT 损失 4.728、PathologyBERT 损失 7.618;作者指出与 PathologyBERT 的比较混合了模型与分词器两方面因素。
继续预训练带来最强的语料级语言拟合:OncoNote-RadBERT 验证损失从 4.728 降至 0.7406,困惑度从 113.04 降至 2.097。 由于 OncoNote-RadBERT 与 RadBERT 共享同一分词器谱系(仅新增 [REMOVED] 特殊词元),这一比较被作者视为继续预训练效果最清晰的证据。 同一分词器谱系下的对照比较;作者提示高频 [REMOVED] 词元也可能对下降有贡献,且模型仅训练一次,结果为点估计。
从零训练配肿瘤专用分词器带来最高分词效率:OncoNoteBERT 子词生育率 1.224、续接词元率 0.01781、归一化序列长度 0.7636,同一批文档约少用 23.6% 词元。 该分词器把 ECOG、T3N2M0、chemoradiotherapy、cisplatin、durvalumab、dysphagia、hypopharynx、mucositis、pembrolizumab 等专业表达表示为单一词元,而继承的 RadBERT 分词器将其切分为多个子词。 在 5,000 份文档样本上统计分词指标,并对肿瘤相关字符串做定向审计;未知词元率对 RadBERT、OncoNote-RadBERT、OncoNoteBERT 均极低(约 4e-8 至 6e-8),PathologyBERT 为 7.42e-3。
语料级拟合与掩码词元行为出现分离:OncoNoteBERT 在 13 个预设填空探针中 12 个进入前五且临床可接受,OncoNote-RadBERT 为 7 个,RadBERT 为 2 个,PathologyBERT 为 1 个。 作者将这一分离部分归因于分词器碎片化而非仅学习到的语义:单掩码位置只能输出一个词元,被切成多个 WordPiece 的表达无法完整生成。 探针集仅 13 个且答案为预设,作者将其定位为定性审计,而非与分词器无关的临床知识或下游性能度量。
启示与展望
该研究面向在受治理的真实世界环境中构建可复用表示骨干的团队,尤其是处理纵向、多用途门诊肿瘤文档并需保留机构去标识约定的场景。其结论适用于英国单一专科肿瘤中心、肺癌与头颈癌门诊笔记这一设定,评估限于内在表示层面:留出掩码语言建模拟合、分词效率、临床术语分词、掩码词元行为与探索性表示几何。作者将 OncoNote-RadBERT 与 OncoNoteBERT 定位为后续任务特定研究的起点,并列出可评估的下游方向,包括治疗与毒性抽取、治疗反应分类、表型识别、肿瘤分期抽取以及生存或治疗决策建模。把 [REMOVED] 保留为专用词元,使模型能在不接触可识别信息的前提下学习被遮蔽内容出现的语言语境,为在数据驻留工作流中沿用既有去标识约定提供了一种透明做法。
读者仍需留意:语料来自单一英国专科中心且限于肺癌与头颈癌,跨机构、跨瘤种与不同记录习惯的可迁移性尚未确定;每个本地模型只训练一次、使用单一架构与预设配置,报告值为点估计而非多次初始化或超参数下的平均;涉及 PathologyBERT 与 OncoNoteBERT 的困惑度比较混合了模型参数与分词器设计,不宜当作与分词器无关的排序;填空评估仅 13 个预设提示,未覆盖全部临床合理补全;表示分析为探索性,不能确立模型质量或临床效用。此外,[REMOVED] 不区分被遮蔽信息的类别,若类别语义重要,未来可考虑 [NAME]、[DATE]、[LOCATION] 等分设词元,但这取决于去标识系统性能与治理要求;保留该词元也不构成正式隐私保证。后续可关注以分词器特定的伪对数似然或多掩码流程对完整候选字符串打分,以及采用中心化核对齐等方法做跨模型表示比较。
