跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

arXiv

TGCC 用跨层信任门控让被攻陷的 LLM 智能体在数步内自动撤销权限,而非升级

该工作把描述性的多层信任模型变成可运行控制器:用跨层协同算子把前置层缺陷传播到依赖层,用无遗憾在线估计器按观测到的失败设定各层权重,并用信任门控能力控制仅在复合信任与相关前置层通过能力阈值时发放短时、可撤销的授权;作者证明并数值验证,一个抬高行为信任却破坏前置层的隐蔽攻陷无法升级权限,反而在若干交互内自动撤销。