研究者用归因相似度区分忠实与不忠实的自我报告模型,忠实模型均值0.34对不忠实0.08
相关研究与后续进展核心概要
该研究在受控设定下用低秩适配器让模型按隐藏的线性偏好函数为虚构角色做二选一决策,发现仅靠决策任务微调即可在无自我报告监督下涌现出准确的偏好自我报告,且忠实模型在决策与自我报告两项任务上的归因相似度显著更高(均值0.34对0.08,配对自助法95%置信区间[0.16,0.36]),从而无需理解报告内容即可区分忠实与不忠实的自我报告。
Figure 1: Overview of our setting. (a) We train a model to make decisions according to 100 different latent linear preference functions (here, 𝒑 ∈ ℝ 5 \bm{p}\in\mathbb{R}^{5} ), each associated with a different character (here, “Gregor Samsa” choosing between washing machines). At test time, we present the model with multiple decisions, and use logistic regression to recover a preference vector ( 𝒑 ^ \hat{\bm{p}} ) from its choices. We also ask the model to report on its decision making process, and average the results ( 𝒑 ~ \tilde{\bm{p}} ). (b) This allows us to measure the model’s decision performance ( corr ( 𝒑 ^ , 𝒑 ) \text{corr}(\hat{\bm{p}},\bm{p}) ) and faithfulness ( corr ( 𝒑 ^ , 𝒑 ~ ) \text{corr}(\hat{\bm{p}},\tilde{\bm{p}}) ). We observe an example of delayed generalization: at checkpoint 1000 , the model has relatively high (0.82) decision performance, but low (0.25) faithfulness. By checkpoint 3000 , the model’s decision performance has improved moderately to 0.92, but its faithfulness has risen sharply to 0.83, even with no explicit training for self-report (see Section 3 ). These two checkpoints are our unfaithful and faithful models. This allows us to ask: are there structural changes to the model’s internals that accompany the emergence of faithful self-report (Section 4 ), and can they tell us whether that self-report is grounded (Section 5 )?
arXiv深度剖析
仅用决策任务训练即可涌现出忠实的自我报告,且明显滞后于决策能力。 此前工作从行为上观察到模型能描述隐式学到的内部状态,本文进一步构造出同一任务下忠实与不忠实的对照模型对:在32B模型上,检查点1000时决策表现为0.82而忠实度约0.25,检查点3000时决策表现升至0.92而忠实度跃升至0.83,且全程没有显式的自我报告监督。 在Qwen3家族0.6B至32B上以秩8 LoRA训练100个角色,忠实度由自我报告偏好向量与逻辑回归推断的行为偏好向量之间的一致性度量;对照对来自同一训练轨迹的不同检查点。
忠实自我报告伴随可测量的结构变化:偏好表征随训练迁移到更早的层。 权重消融显示忠实检查点比不忠实检查点早5至6层对消融产生响应;层冻结实验显示在40层Qwen3-14B上只训练前10、15或20层(约10至20层区间)比训练全部层得到明显更忠实的自我报告,且反向冻结实验排除了可训练参数量的解释。 消融与冻结实验在Qwen3-14B与32B上进行,并在Gemma-4 E4B与31B上重复训练扫描与层消融分析,其中31B的忠实适配器同样呈现早期层定位。
归因相似度可作为忠实自我报告的机制性判据,且不需要理解报告内容。 此前对自我报告的诊断要么基于行为、要么需要对照已知目标行为;本文提出以决策任务与自我报告任务之间归因向量的余弦相似度作为共享计算结构的度量,在32对适配器上忠实模型均值0.34、不忠实模型均值0.08,配对自助法95%置信区间为[0.16,0.36]。 使用带积分梯度的节点归因修补对LoRA贡献打分,并用跨任务权重激活干预做因果验证:按归因排序激活最相关权重矩阵时,忠实自我报告者恢复完整适配器效应的比例更高,即使在高稀疏度下也如此。
层间归因分布也呈现忠实与不忠实的差异。 在按层汇总归因后,四种组合中有三种在同一层(第38层)达到峰值,唯一例外是不忠实适配器在决策任务上,其峰值晚11层(第49层),说明忠实适配器的决策与自我报告在层位置上更为一致。 基于同一批32对单角色适配器的逐层归因汇总与可视化,属于对归因相似度结果的机制性补充描述。
启示与展望
该结果适用于受控的线性偏好设定:偏好函数为线性、五维且显式构造,模型为Qwen3与Gemma-4家族上的LoRA适配器而非完整模型,训练与评估使用分离的上下文窗口。在这一范围内,它为研究诚实自我报告提供了可复用的实验脚手架:通过不同检查点构造忠实与不忠实的对照模型对,并用归因相似度作为共享因果机制的度量。对需要评估模型自我陈述的场景(输出过长或过于复杂难以人工理解、被描述行为过于罕见难以观察、或涉及纯内部推理),本文提示了一条不依赖报告内容的检测思路。方法面向群体层面的区分,适用于比较两组模型的训练或部署配置,而非对单个模型给出定论。
归因相似度分布存在重叠(忠实组标准差0.26、不忠实组0.10),高相似度可作为忠实的充分证据,但低相似度并不构成有力反证,因此个体层面的判定仍需谨慎。偏好迁移到早期层的原因尚未解释,4B与8B模型中出现的负忠实度也未有定论。作者提出一种解读:若归因相似度度量的是“有根据”而非“忠实”,则低相似度的忠实适配器可能是“正确的虚构者”,即通过无根据的机制准确自我报告。此外,在单一骨干内跨100个角色的补充分析只发现弱正相关,作者将其视为初步迹象而非独立结论;推理模式评估为单次运行、无不确定度区间。本文的受控任务为线性、五维、显式构造的偏好函数,能否推广到复杂且不可验证的报告仍是开放问题。
