跳到主要内容
返回时间线
arXiv来源发表:

组合式策略违规:当智能体工作流中的逐步合规失效

核心概要

本文提出并形式化了“组合式策略违规”(CPV)这一治理失效模式:在智能体工作流中每一步都通过各自的局部检查,但组合后的执行却违反整体策略,作者据此给出四类分类(权限蔓延、阈值洗白、累积求和违规、上下文坍塌)、指出每类所需的修复拓扑由被守护量在何处发生变化决定,并提出一套基于溯源感知的运行时检测架构,从原始溯源重算被守护量而非信任流水线的派生表示。

Source-provided article image: Compositional Policy Violations: When Step-Level Compliance Fails In Agentic AI Workflows
Figure 1 ·

Figure 1: Taxonomy of compositional policy violations

arXiv

深度剖析

提出并定义了组合式策略违规(CPV):每个步骤都满足其局部策略,但组合执行违反工作流层面的策略,且没有任何组件出错。 既有工作(Llama Guard、NeMo Guardrails、Constitutional Classifiers、AgentSpec 等)在提示、回复、轮次或单个动作层面执行约束;已有组合失效研究假设存在对抗性行为者刻意拆分行为,而本文聚焦非对抗性的、由独立授权组件在正常执行中产生的组合失效。 概念与形式化论证为主,辅以承保、采购等说明性案例(如四类例外经归一化、去重、重要性分类后从四降到一,未触发三级升级门槛),未报告实证评测或数据集。

给出四类 CPV 分类:权限蔓延、阈值洗白、累积求和违规、上下文坍塌,并说明它们共享 CPV 结构而非共同机制。 将“组合后不安全”的方面作为分类维度:权限蔓延关乎谁有权决定;阈值洗白与累积求和违规关乎累积量(前者有门但位置过早,后者在聚合层面根本没有门);上下文坍塌关乎决策所依据的表示。 以逐步骤表格化示例支撑:阈值洗白中 $210K 通过 $250K 门槛后追加 $75K 在窗口内索赔使承诺值达 $285K;累积求和违规中三笔 $90 采购各自低于 $100 单笔上限但合计 $270 超过 $250 日上限;上下文坍塌中每跳漂移 0.06、0.08、0.07 累积至 0.19 使决策由“转介”翻转为“接受”。

论证修复拓扑由被守护量在何处发生变化决定,而非设计选择。 四类各需不同修复:权限蔓延需从决策点向后追溯一次;阈值洗白需在承诺状态上重新评估既有谓词;累积求和违规需在聚合自身范围引入此前无人持有的谓词;上下文坍塌需针对原始提交而非中间摘要重建。 以风险值示例说明:单点门在第 1 步看到 risk=0.79 通过,第 3 步加入门从未观察到的暴露使值越过 0.80,说明门执行的是时点谓词而策略要求的是承诺状态上的不变式。

提出溯源感知的运行时检测架构,包含四个核心阶段与两条设计不变式。 阶段为溯源摄取与归一化、状态重建、策略评估、组合检测;不变式为历史完整性(不得基于截断或窗口化视图作出违规判定)与从原始溯源重算(组合门必须按策略自身语义从原始溯源重算被守护量,绝不使用流水线的变换或派生表示)。 架构性提案,含序列分析器针对四类各自的检查逻辑与违规检测器输出;作者同时列出检测器失效模式,包括溯源丢失、主观谓词的判定依赖、抽取误差、部分与异步可观测性、实体解析、隐藏状态与成本。

启示与展望

该工作面向在受监管场景中运行智能体工作流的组织,尤其是那些持有转介阈值、权限上限与复核要求等整体执行属性的机构;其分类与修复拓扑适用于纯顺序、设计正确且局部检查齐备的工作流,检测架构假定每个工作流实例有有序事件日志并保留原始溯源。它为进一步工作开启的方向包括:标准化策略语言与治理意图到工作流溯源的语义映射、类似公平性与可解释性领域的仿真测试平台与基准数据集、高效轨迹分析与实时溯源捕获,以及在受监管工作流中的领域特定实例化与验证。

谨慎的读者仍会关注若干开放问题:主观谓词(如“例外是否重大”)的重算需要解释判定器,若该判定器与产生违规的流水线组件同为语言模型且先验相近,可能得出相同判断而使检测器无从发现差异;溯源保留是前提而非实现细节,若某变换删除被抑制的证据而非标记它,违规在原则上不可检测;抽取误差、分布式执行下的时钟偏移与乱序投递、实体解析错误、以及未作为事件暴露的隐藏状态都会削弱判定;成本方面,保留原始溯源并在提交时重算被守护量会随轨迹长度与门控量数量增长,上下文坍塌中从原始提交重新推导决策的成本接近未自动化决策本身。此外,本文为快速解析文本,图表(图 1 至图 6)与表格(表 1、表 2)以文字描述形式出现,若需核对具体图示细节,应回到原文图表。

来源