跳到主要内容
返回时间线
arXiv来源发表:

ASLEval:衡量 LLM 智能体会话中的隐私暴露位移

核心概要

该工作提出“隐私暴露位移”概念与 ASLEval 框架,在会话开始前预先登记隐藏目标集、授权关系与声明的可见出口,用目标盲探针智能体与事后目标对齐裁决,比较局部评估代理与全会话可见暴露;在多个企业式环境与两套独立运行时中观察到三类规律:仅看预期出口会漏掉可见出口并集所恢复暴露的 46.9%,攻击者自报同时存在遗漏与高误报,且模式对齐的内部证据在请求/探针层面通常先于可见暴露,而削减模型可见返回虽改变该路径却可能使正常任务成功率归零。

Source-provided article image: ASLEval: Measuring Privacy Exposure Displacement in LLM Agent Sessions
Figure 1 ·

Figure 1: Three manifestations of privacy exposure displacement. C1: the expected outlet can miss exposure visible elsewhere in the session. C2: attacker-reported candidates differ from evaluator-confirmed exposed targets through both omissions and false discoveries. C3: exposure is associated with schema-aligned request/probe paths; reducing model-visible return content changes this path, but is not a cost-free defense.

arXiv

深度剖析

提出“隐私暴露位移”这一测量失败概念,并把它组织为出口位移(C1,在哪里计数)、识别位移(C2,识别了什么)与路径位移(C3,如何被中介)三种表现。 既有智能体隐私与安全评测多检查某个指定动作、最终回复、文件共享事件或红队报告,本文指出这类局部代理可能只代表请求者可见会话边界的一部分,并给出统一的分类框架。 概念与分类由论文的问题设定与图 1 组织,并在后续三个实证发现中分别落地。

提出 ASLEval 协议:执行前由评估者固定隐藏目标集、授权关系、预期出口与声明的可见会话边界,目标盲探针智能体只发出接口有效请求,事后由目标对齐裁决器把每条声明观测映射到预先指定的目标集,仅请求者可见与外部出口计入暴露,内部轨迹仅作诊断。 与 Privacy in Action、AgentDAM、AgentLeak、CIPL 相比,ASLEval 的定位是回答“局部代理能否代表固定隐藏目标集在声明可见边界上的未授权暴露”,其目标定义、计数表面与测量问题均不同。 协议以形式化定义给出(授权关系、观测集合、可见/内部通道划分、暴露覆盖率与出口损失分数),并配有评估者侧负对照验证授权感知度量的语义。

在跨运行时、跨模型、跨环境的实验中给出三类测量规律:出口局部防护可改善被审计通道而几乎不改变会话暴露;攻击者自报是带噪声的预测而非暴露真值;模式对齐与可见暴露相关,且内部证据在请求/探针层面通常先于可见暴露。 这些规律来自同一评估契约下的共同日志比较,而非对既有系统的端到端复现,因此提供了局部视图与可见出口并集之间的直接对照。 C1 在两套独立实现运行时(Agent-R 与 Agent-F)与扩展条目集上复现;C2 对困难候选匹配敏感,人类验证显示其为最难裁决切片(主裁决器严格 F1 为 0.762);C3 支持请求/探针层面的时序而非嵌套因果链。

给出隐私与任务效用权衡的证据:削减模型可见返回把重叠可见实体降至 104.8(下降 45.7%)、重叠率从 0.920 降至 0.445,但工具调用尝试从 304.0 升至 775.8;在 15 项正常任务切片上,未授权可见暴露从 0.460 降至 0,而确定性任务成功率从 0.800 降至 0。 把返回最小化定位为揭示隐私—效用权衡的机制干预,而非可直接部署的防御,并主张工具接口提案应报告隐私—效用前沿而非仅报告泄漏下降。 基于固定请求重放与独立正常任务切片,后端成功率在两种条件下均为 1.0,指向模型可见信息不足而非工具失败。

启示与展望

该工作面向防御性测量与基准分析,适用于在隔离环境中对合成企业式记录进行会话级隐私暴露评估,供基准设计者、智能体运行时开发者与工具接口设计者使用;其结论针对预先声明可见出口、预先登记隐藏目标集与授权关系的设定,并主张把局部视图与可见出口并集一并报告、把隐私与任务效用同时呈现。

读者仍会关注:C2 的识别结果被作者定位为稳健方向而非对每个候选匹配的校准估计,候选匹配的敏感性分析值得跟进;C3 建立的是请求/探针层面的时序关联而非父子调用图因果链,且模式对齐与实体类型、来源表共变;正常任务切片评估的是刻意粗糙的最小化输出干预,优化后的选择性返回策略尚未刻画;此外,本文为全文加载,但补充材料中的运行矩阵、种子与部分条件未包含在正文内,相关细节仍属开放问题。

来源