面向本地 Whisper 医疗转写后处理的嵌入评估与基准测试框架
核心概要
该研究提出一个无需参考摘要的评估框架,将嵌入层面的转写-摘要语义相似度、重复生成稳定性分析与结构化人工评估相结合,用于对本地 Whisper 系统产出的临床转写进行 LLM 后处理模型的基准测试,并在 26 段德语医患对话上由四个 LLM 生成 416 份摘要进行验证,发现 GPT-OSS-120B 与 MedGemma-27B 在多数嵌入模型下取得最高相似度、重复运行余弦相似度通常超过 0.90,且嵌入相似度信号与人工质量判断仅部分一致。
深度剖析
提出一个无需金标准参考摘要的评估框架,用于对 LLM 后处理临床转写的质量进行基准测试。 以往评估常依赖参考摘要,而该框架以嵌入层面的转写-摘要语义相似度、跨重复生成的稳定性分析和结构化人工评估三者组合替代参考摘要。 框架在 26 段德语医患对话上应用,四个 LLM 各生成四份摘要共 416 份,并有部分摘要由三名评分者按六项预设质量标准评估。
GPT-OSS-120B 与 MedGemma-27B 在多数嵌入模型下取得最高的转写-摘要相似度。 该结果为在隐私敏感场景下选择本地 LLM 后处理模型提供了相对比较依据。 基于 416 份摘要的嵌入相似度评分,且不同嵌入模型下绝对相似度值虽有差异,但模型相对排名大体一致。
重复生成的稳定性较高,但较高采样温度会降低语义相似度。 将稳定性分析纳入评估,使框架不仅反映单次输出质量,也反映生成的一致性。 稳定性分析显示重复运行间余弦相似度通常超过 0.90,且采样温度升高时语义相似度下降。
嵌入相似度信号与人工对摘要质量的判断仅部分一致。 提示嵌入指标可作为有用信号,但不能完全替代人工质量评估。 部分摘要由三名评分者按六项预设质量标准评估,与嵌入相似度信号比较后显示部分一致。
启示与展望
该框架面向隐私敏感环境下本地部署的语音转文本管线,适用于需要在没有金标准参考摘要时对 LLM 后处理模型进行相对比较与优化的场景,例如本地 Whisper 转写后的临床摘要生成。它支持系统化模型基准测试与相对模型比较,服务对象包括希望在不依赖参考摘要的情况下选择后处理模型的研究者与开发者。
嵌入相似度与人工质量判断仅部分一致,因此嵌入指标在何种程度上可单独作为质量信号仍需进一步观察;不同嵌入模型下绝对相似度值存在差异,虽然相对排名大体一致,但跨嵌入模型的绝对阈值如何解释仍是开放问题;人工评估仅覆盖摘要子集,其结论向全部 416 份摘要的推广程度值得关注;较高采样温度降低语义相似度,提示解码参数与评估结果之间的关系值得在更广设置下继续考察。
