跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

arXiv

研究者用归因相似度区分忠实与不忠实的自我报告模型,忠实模型均值0.34对不忠实0.08

该研究在受控设定下用低秩适配器让模型按隐藏的线性偏好函数为虚构角色做二选一决策,发现仅靠决策任务微调即可在无自我报告监督下涌现出准确的偏好自我报告,且忠实模型在决策与自我报告两项任务上的归因相似度显著更高(均值0.34对0.08,配对自助法95%置信区间[0.16,0.36]),从而无需理解报告内容即可区分忠实与不忠实的自我报告。