在三个7B级模型与三个数据集上,幻觉信号被单一均值漂移方向主导,简单L2逻辑回归达到0.952 AUROC并超过十二种架构替代方案
核心概要
该工作在配对样本范式下跨三个7B级模型和三个数据集刻画隐藏状态探针检测LLM幻觉的信号几何,发现信号由单一均值漂移分量主导、移除该方向后检测降至随机水平,收缩线性判别分析弥合约73%的一维与全维分类器差距,简单L2正则逻辑回归以0.952 AUROC界定或优于十二种受控架构替代方案,且LayerMix多层聚合在无oracle访问下匹配oracle层性能。
Figure 1: 2D projection of factual and hallucinated hidden states from Qwen2.5-7B (Layer 18) on TruthfulQA.
arXiv深度剖析
幻觉检测信号在隐藏状态中由单一均值漂移分量主导,移除该方向后检测性能崩溃至随机水平。 此前工作虽显示隐藏状态探针有效,但信号几何未被充分刻画,导致探针架构日趋复杂;该工作直接给出信号几何的主导结构。 在三个7B级模型和三个数据集的配对样本范式下观察到该主导性,并通过移除该方向后检测崩溃至随机水平加以验证。
收缩线性判别分析弥合约73%的一维与全维分类器之间的差距,表明表面上的架构复杂性主要反映高维协方差估计困难而非可利用的非线性。 将复杂探针架构的收益归因于高维协方差估计问题,而非信号本身需要非线性建模。 以收缩线性判别分析作为对照,量化其在一维与全维分类器差距上的弥合比例约为73%。
简单L2正则逻辑回归以0.952 AUROC界定或优于十二种受控架构替代方案,且多层聚合在匹配范式下超过CLAP跨层注意力探针。 在受控比较中,简单线性探针不劣于甚至优于更复杂的架构替代方案,并优于CLAP跨层注意力探针。 报告0.952 AUROC,并与十二种受控架构替代方案及CLAP跨层注意力探针在匹配范式下比较。
信号跨越连续层带,LayerMix聚合该层带可在无oracle访问下匹配oracle层性能。 提供一种无需oracle层选择即可达到oracle层性能的多层聚合方式。 基于信号跨越连续层带的观察,LayerMix在无oracle访问条件下匹配oracle层性能。
启示与展望
该工作面向在受控配对样本范式下研究LLM幻觉检测的研究者与工程师,适用于7B级模型与所考察的三个数据集;其结论明确限定于该范式之内。对希望以简单线性探针替代复杂架构、或在无oracle层访问条件下进行多层聚合的实践者,LayerMix与L2正则逻辑回归提供了可直接采用的方向。
信号几何是否在更大规模模型、其他数据集或其他任务范式下同样由单一均值漂移主导,仍是开放问题;收缩LDA弥合约73%差距的结论依赖于所考察的一维与全维分类器设定;0.952 AUROC与十二种架构替代方案的比较结果受受控实验条件约束;LayerMix匹配oracle层性能的结论建立在信号跨越连续层带的观察之上。
