跳到主要内容
返回时间线
arXiv来源发表:

Pincer 用数字孪生为编码智能体做资源授权,在安全与效用上均优于 LLM 评委与 Conseca 改编基线

相关研究与后续进展

核心概要

Pincer 是一种作用于资源层的防御机制,其核心是一个隔离上下文中的数字孪生模型,能够自动学习并执行动态的、用户特定的最小权限策略,作为用户代理处理智能体的权限请求;作者提出一个基于多日用户—智能体交互记录的用户中心数据集来模拟学习阶段,评估显示 Pincer 在安全与效用两方面均强于包括多种 LLM 评委变体和 Conseca(HotOS '25)改编在内的基线,并在某些攻击类型上带来显著安全提升。

Source-provided article image: Pincer: Resource Authorization for Agents using a Digital Twin
Figure 1 ·

Figure 1: The architecture today’s coding agents have converged on. An LLM drives an autonomous loop over persistent memory and general-purpose tools and acts on external resources, such as local files, the network, and remote services, through those tools. The box encloses the components under the agent’s own control; the user and the resources the agent acts on sit outside it.

arXiv

深度剖析

提出 Pincer:一种在资源层运行、可与工具调用层防御(如 auto mode)并存的防御机制,核心是隔离上下文中的数字孪生模型,自动学习并执行动态的用户特定最小权限策略。 既有防御要么限制架构(类型化工具、信息流控制、策略预测引擎)而牺牲过多功能,要么依赖用户维护的策略(会随时间衰减并造成用户疲劳)或 auto mode 的工具调用分类器(不学习用户特定策略、并非针对对抗性设置)。Pincer 把学习与执行放到资源层,并让数字孪生充当用户对权限请求的代理。 摘要层面的设计陈述,未给出实现细节或策略表示形式。

数字孪生持续学习用户偏好,从而作为用户代理回应智能体的权限请求。 与静态、用户手工维护的策略相比,这一机制把策略维护从用户转移到持续学习的模型上,针对的是策略衰减与重复授权请求导致的用户疲劳。 摘要中的机制描述,未报告学习算法、更新频率或收敛性证据。

提出一个用户中心数据集,用多日用户—智能体交互记录中的示例来模拟学习阶段。 为数字孪生的学习阶段提供可复现的评估载体,而摘要未提及此前存在同类用户中心交互数据集。 摘要仅说明数据集由多日交互记录构成,未给出规模、采集方式或标注协议。

评估显示 Pincer 在安全与效用上均表现强劲,优于多种 LLM 评委变体与 Conseca(HotOS '25)改编等基线,并在某些攻击类型上取得显著安全提升。 把资源层授权与工具调用层分类器及既有策略执行方案放在同一比较框架下,并同时报告安全与效用两个维度。 摘要层面的比较结论,未给出具体指标数值、攻击类型名称或效应量。

启示与展望

该工作面向长时程、自主、依赖通用 shell 并维护持久记忆的编码智能体,其防御定位在资源层,设计上与工具调用层防御(如 auto mode)并存而非替代。数字孪生被描述为隔离上下文中的模型,持续学习用户偏好并充当用户对权限请求的代理,因此其目标场景是存在稳定用户偏好、且用户愿意让代理代为决策的部署。作者提出的用户中心数据集以多日用户—智能体交互记录模拟学习阶段,为在受控条件下复现该学习过程提供了载体。评估的比较对象包括多种 LLM 评委变体与 Conseca(HotOS '25)改编,覆盖安全与效用两个维度,并指出某些攻击类型上 Pincer 相对所有基线有显著安全提升。

摘要未说明数字孪生如何表示与更新用户特定策略、如何处理偏好冲突或漂移,也未给出数据集的规模、采集与标注方式。评估部分只报告了相对基线的定性结论,未列出具体指标数值、攻击类型名称与效应量,因此难以判断安全提升的幅度与统计稳健性。此外,摘要未说明 Pincer 与 auto mode 等工具调用层防御组合部署时的交互方式与开销。由于本次可获取的是摘要而非全文,上述细节属于待原文确认的开放问题。

来源