LUMOS 用 OLMo 2 透明训练语料追踪参数知识:罕见事实内部可分离度 84% 但行为表达仅 54%,自我反思在未见内容上跌至 49%
相关研究与后续进展核心概要
作者提出 LUMOS 诊断框架,借助训练语料完全透明的 OLMo 2,把大模型参数知识的分析从只看输出改为沿“训练数据曝光→行为输出”的因果链追踪,发现模型对罕见事实的内部编码可分离度达 84% 却只有 54% 能在行为上表达(该检索差距随规模缩小),自我反思在已训练内容上可靠(83%)但在未见内容上跌至随机基线水平(49%),且该崩塌在思维链提示下依然存在,提示反而抬高置信信号而非改善校准。
Figure 1 : A 2×2 taxonomy of model knowledge states defined by data exposure ( 𝒟 \mathcal{D} ) and behavioral accuracy ( A A ), enriched with parametric and decoding depth (Probabilistic Confidence ( P C PC ), Decisional Consistency ( D C DC )).
arXiv深度剖析
提出 LUMOS 诊断框架,把参数知识评估锚定在可验证的训练数据曝光上,而非仅凭模型输出推断其“知道什么”。 以往分析以输出为中心,无法区分正确回答来自真正的泛化还是死记硬背;LUMOS 利用 OLMo 2 完全透明的训练语料,沿训练数据曝光到行为输出的因果链进行追踪。 基于 OLMo 2 及其完全透明训练语料构建诊断框架,摘要报告了内部可分离度、行为表达率与自我反思准确率等量化结果。
模型内部能以高可分离度(84%)编码罕见事实,但行为表达率仅 54%,存在明显的检索差距,且该差距随模型规模增大而收窄。 把“内部编码”与“行为表达”分开测量,使知识存在与知识可用之间的落差成为可验证的量,而非推测。 摘要给出 84% 与 54% 两个具体数值,并指出该检索差距随规模缩小。
模型对自身答案的自我反思在已训练内容上表现可靠(83%),但在未见内容上跌至随机基线水平(49%)。 将自我反思能力与训练数据曝光直接挂钩,显示其可靠性依赖于内容是否被训练过。 摘要报告 83% 与 49% 两个准确率数值,并明确将 49% 描述为随机基线水平。
思维链提示无法修复上述崩塌,反而抬高置信信号而非改善校准。 说明该失败模式不是提示策略可以简单绕过的,提示带来的更多是信心膨胀。 摘要明确陈述该崩塌在思维链提示下依然存在,且提示抬高置信信号而非改善校准。
启示与展望
该工作面向大模型参数知识评估这一场景,适用于训练语料可完全追溯的模型(如 OLMo 2),使研究者能够把内部编码、行为表达与自我反思的可靠性放到同一因果链上比较;其结论意在说明纳入训练数据轴后,关于模型“知道什么”的判断可以从推测转为可验证的陈述,并为后续按规模、按内容是否被训练过进行分层分析提供框架。
当前可见文本仅为摘要,缺少实验细节、样本构成与统计信息,因此 84%、54%、83%、49% 等数值对应的具体任务、数据划分与评估协议仍属开放问题;检索差距随规模缩小的具体趋势、思维链提示抬高置信信号的度量方式,以及该框架在训练语料不透明的模型上如何落地,都需要在正文中进一步确认。
