TGCC 用跨层信任门控让被攻陷的 LLM 智能体在数步内自动撤销权限,而非升级
相关研究与后续进展核心概要
该工作把描述性的多层信任模型变成可运行控制器:用跨层协同算子把前置层缺陷传播到依赖层,用无遗憾在线估计器按观测到的失败设定各层权重,并用信任门控能力控制仅在复合信任与相关前置层通过能力阈值时发放短时、可撤销的授权;作者证明并数值验证,一个抬高行为信任却破坏前置层的隐蔽攻陷无法升级权限,反而在若干交互内自动撤销。
Fig. 1: (a) Steady-state trust (bars) vs. analytic fixed point T ⋆ T^{\star} (diamonds), MAE 0.007 0.007 (Proposition 1 ). (b) Failure-grounded weights α ℓ ( t ) \alpha_{\ell}(t) shift toward the epistemic layer after compromise (Lemma 2 ).
arXiv深度剖析
提出跨层协同算子与广义均值复合信任,把前置层缺陷传播到依赖层,并在极限情形下恢复最弱环节规则。 既有分层信任模型多为描述性,只说明哪些信任维度重要,未给出层间如何组合;该工作给出可证明边界的组合方式,并证明复合信任被最弱有效层以有界松弛量钉住。 以定义、引理与定理形式给出良定义性、单调性与边界,并在 20,000 次随机抽样中报告零边界违反。
用无遗憾在线估计器(Hedge)按运行时失败归因动态设定各层重要性权重,使复合信任对当前最致害的层最敏感。 以往信任系统多固定权重或只跟踪单一标量信任;该工作把系统失败记录直接接入信任计算,并继承 Hedge 的无遗憾保证。 给出无遗憾层跟踪引理,并在数值实验中观察到权重向成为主导失败源的认知层偏移。
提出信任门控能力控制:仅当复合信任与相关前置层通过能力特定阈值时发放短时、可撤销的能力授权,并证明其打破信任—脆弱性悖论。 零信任与协议工作确立了信任须可撤销、能力须最小权限,但未规定如何把多维信任信号聚合为授权策略;该工作补上这一策略层,并给出闭式保守信任不动点与有界延迟撤销保证。 以定理证明隐蔽攻陷下高风险能力被撤销且授权集随攻陷深度非增,并以推论给出对数步数的自撤销延迟;数值实验中解析不动点与仿真平均绝对误差为 0.007,攻陷后平均数步内撤销。
启示与展望
该结果面向由控制器中介能力授予的多智能体 LLM 协作场景,适用于部署者能设定每能力风险阈值、且各层可提供带噪但具信息量的成功信号(如校准探针、角色一致性检查、审计轨迹)的设定。它使运行时逐步重评估与即时撤销在每步常数开销下可行,因而对需要在长时协作中防止隐蔽攻陷升级的工程团队、以及希望把零信任原则落到授权策略的协议实现者有直接用处。框架还给出向具身或感知智能体(以传感器融合置信度或感知异常分数作为认知层证据)以及智能体市场激励层的扩展路径。
仿真实例化的是单智能体在睡眠者威胁下的层信任动态,而非真实多智能体部署;各层检查的信号质量、依赖结构与耦合矩阵的设定方式,以及部署者如何标定每能力风险阈值,仍是实际落地时需要回答的问题。跨模态与经济激励扩展在文中为设想,尚待独立验证。此外,原文中若干公式与数值(如具体阈值、平均撤销步数)在文本抽取中未完整呈现,读者若需精确参数应查阅原文图表。
