稀疏自编码器定位临床分诊格式效应:医学特征在决策 token 处失活,脚手架特征占 Gemma 归因逾 91%
相关研究与后续进展核心概要
该研究用稀疏自编码器(SAE)特征分析 Gemma 3 4B/12B IT 与 Qwen3-8B 在临床分诊情景下的表现,发现医学特征在两种格式下都激活于共享临床叙述,但在多选题决策 token 处失活;急诊分级信息在情景表征中线性可解码(ROC-AUC 0.95–1.00)且无显著格式差异,却在决策 token 处被衰减,脚手架峰值特征在 Gemma 模型中占未符号归因的 91% 以上,从而把格式效应的最强相关因素定位在答案选择阶段。
Figure 1: Study overview. Within each input style, the clinical text is held fixed while output format changes (left). The analyses progressively test behavior, error composition, vignette-level representation, decision-token localization, and case-level predictability (right).
arXiv · 第 3 页深度剖析
医学特征在两种作答格式下都激活于共享的临床叙述,但在多选题决策 token 处不活跃。 此前对多选题分诊失败的观察停留在行为层面,该工作把分析推进到模型内部表征,区分了病例处理阶段与答案映射阶段。 基于 Gemma 3 4B/12B IT 与 Qwen3-8B 的 SAE 特征分析,并辅以自然语言自编码器言语化与 top-feature 刻画。
急诊分级信息可从情景表征中线性解码,ROC-AUC 为 0.95–1.00,两种格式间无显著差异,但在决策 token 处被衰减。 说明格式差异并非源于临床信息未被编码,而是信息在最终答案映射处被削弱。 线性解码的 ROC-AUC 区间与格式间无显著差异的统计结果。
在直接线性投影中,已识别的医学特征贡献为零,而脚手架峰值特征在两个 Gemma 模型中占未符号归因的 91% 以上。 把格式效应的归因从医学内容转向多选题脚手架本身。 直接线性投影的归因分析,覆盖两个 Gemma 模型。
行为上多选题是否改善或损害表现取决于模型;选项顺序打乱排除了简单位置偏置,格式间不同的病例通常相差一个严重度层级。 为格式效应提供了行为层面的边界条件,并排除了位置偏置这一替代解释。 选项顺序打乱实验与格式间差异病例的严重度层级比较。
启示与展望
该工作面向使用多选题情景评估 LLM 临床分诊的研究者与评估设计者,适用于 Gemma 3 4B/12B IT 与 Qwen3-8B 这类模型在临床分诊情景下的分析场景。它把格式效应的最强相关因素定位在答案选择阶段,为后续区分病例处理与答案映射的研究提供了可复现的分析路径,代码与数据已在研究仓库公开。
作者明确指出,未测量的临床表征是否也存在格式差异仍属开放问题。此外,本次读取为摘要级范围,缺少样本量、病例数、统计检验细节与图表信息,这些缺口会影响对效应稳健性与泛化范围的判断,读者若需评估结论强度应查阅原文与公开仓库。
