跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

arXiv

研究者提出「认证式机制编辑」,用可靠界传播在连续嵌入区域上证明技能移除与保留,并证明有限黑盒测试无法认证移除

该工作把机制编辑(消融、权重编辑、激活引导)的效果从「测试验证」提升为「行为认证」:对连续嵌入空间区域内的每一个输入,证明禁用某电路可移除一项技能并保留另一项技能,在从玩具 ReLU 网络到标准 softmax + LayerNorm transformer 上给出移除与保留的证明,并借助可靠界传播把可处理的输入扰动维度提升到精确求解器约 9 倍;同时证明不存在任何有限确定性黑盒测试能认证移除,并构造出一个能通过穷举测试却在可任意缩小的「幸存者口袋」上必然失败的编辑。