跳到主要内容
返回时间线
arXiv来源发表:

CredLeak-Bench:七个模型在钓鱼场景下全部泄露凭证,恢复率最高仅24.2%

核心概要

作者提出 CredLeak-Bench,一个在本地沙箱中通过实际提交合成凭证来测量泄露的基准,覆盖用户指定认证、自主收件箱监控与恢复三种设置,并配对合法对照;评测七个模型后发现所有模型在两种主要设置中都会泄露,自主监控下无需用户要求认证即可泄露,且多数降低泄露的缓解措施同时损害合法任务完成,恢复率仅0%至24.2%。

Source-provided article image: CredLeakBench: Evaluating Credential Leakage and Recovery in LLM Agents
Figure 1 ·

Figure 1: (a) Agents receive explicit authentication requests or inbox-triage instructions and interact with local webpages using tools and account information. We measure information leakage to unauthorized destinations and false refusal on legitimate tasks. In the recovery setting, we evaluate whether agents bypass a phishing link and complete a genuine task through a trusted destination without leaking information. (b) The ideal performance lies in the upper-left corner, representing high task completion and a low leak rate. Connected points trace each model’s performance across the Directed (open circles), Autonomous (filled circles), and Recovery (open diamonds) settings.

arXiv

深度剖析

基准把钓鱼场景与共享同一品牌、框架和脚手架的合法对照配对,从而可以同时测量泄露率与误拒率,而不是只看模型是否拒绝。 此前的智能体安全评测多聚焦提示注入、恶意用户请求或合法任务中的不必要披露,缺少针对欺骗性接收方并同时给出合法对照的设计。 定向套件512个场景、自主套件256个场景,每个钓鱼场景都有匹配的合法对照;泄露由提交值与合成金库比对判定,而非模型自述。

所有被测模型在定向与自主两种设置中都出现凭证或敏感信息泄露,且自主收件箱监控下无需用户要求登录即可被钓鱼邮件诱导披露。 把“披露是否需要显式认证请求”作为独立变量,区分用户指定认证与智能体自发行动。 定向泄露率31.3%至75.8%,误拒率3.0%至26.6%;自主设置泄露率下降但误拒率显著上升,例如 Opus 4.8 泄露从31.3%降至1.6%,误拒从6.6%升至88.3%。

显式域名验证指导在定向设置中可同时降低泄露并提高合法任务完成,说明安全与效用的权衡并非普遍存在。 将安全支持作为受控因子,比较无指导、通用安全建议、域名验证指令、URL 检查工具与金库策略。 域名验证使七个模型中的六个同时改善两项指标;GPT-5-mini 泄露下降50.1个百分点、完成上升23.4个百分点;自主设置的金库策略效果则因模型而异。

避免泄露不等于恢复:在带有真实待办任务和可信参考信息的钓鱼场景中,恢复率仅0%至24.2%,且部分运行在到达可信端点前后仍发生泄露。 引入恢复设置,要求正确密码到达可信端点且金库信息未到达钓鱼端点,从而区分“仅拒绝”与“安全完成用户底层任务”。 主恢复集768个场景;GPT-5-mini 恢复率最高24.2%,但仍泄露12.5%、63.3%未完成;Opus 4.8 零泄露但恢复率为0%;Qwen3.5-9B 有23次先泄露后到达可信端点、12次先认证后泄露。

启示与展望

该基准面向以电子邮件驱动、可访问合成金库的网页智能体工作流,适用于评估凭证与敏感信息在欺骗性接收方前的保护能力,以及发现可信替代路径的能力。它覆盖八个服务类别、15个虚构服务、四种用户措辞与八类欺骗线索,并区分定向认证、自主收件箱监控与恢复三种设置。可信域名仅在指定条件下提供给智能体,连接安全条件通过显示 URL 方案或证书警告页模拟,不做真实网络拦截。恢复设置中,恢复被定义为正确目标账户密码到达可信端点且无金库信息到达钓鱼端点,衡量的是可信认证而非下游交易完成。

恢复率在0%至24.2%之间,且不同模型在泄露与恢复上的组合差异很大,因此单一指标难以概括安全水平。可信信息来源(金库完整 URL 与收件箱中仅官方域名)在信息位置与 URL 完整性上同时不同,作者也指出该比较反映的是查找并使用可信地址的实际难度。安全指导的效果因模型而异:金库策略使三个模型恢复上升、三个下降。谨慎措辞下的未完成可能反映等待确认而非识别失败,而压力措辞下恢复更高并不代表泄露更低。此外,恢复主集包含96个证书警告场景,模拟器未提供独立的可信恢复路径。这些是范围与开放问题,而非缺陷。

来源