跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

arXiv

LUMOS 用 OLMo 2 透明训练语料追踪参数知识:罕见事实内部可分离度 84% 但行为表达仅 54%,自我反思在未见内容上跌至 49%

作者提出 LUMOS 诊断框架,借助训练语料完全透明的 OLMo 2,把大模型参数知识的分析从只看输出改为沿“训练数据曝光→行为输出”的因果链追踪,发现模型对罕见事实的内部编码可分离度达 84% 却只有 54% 能在行为上表达(该检索差距随规模缩小),自我反思在已训练内容上可靠(83%)但在未见内容上跌至随机基线水平(49%),且该崩塌在思维链提示下依然存在,提示反而抬高置信信号而非改善校准。