跳到主要内容
返回时间线
发表出处待核验来源发表:

研究者扫描609万个公开URL,发现12331个疑似敏感信息泄露,含26个可用密码重置链接与62个无过期JWT

核心概要

作者构建了一套结合词法URL过滤、动态渲染、OCR提取与内容分类的自动化检测系统,对来自VirusTotal、URLScan.io、Hybrid Analysis、Wayback Machine和RedHunt粘贴站点的6,094,475个公开URL进行扫描,识别出12,331个疑似敏感信息暴露,涵盖认证令牌、财务、个人身份与文档等类别,并发现26个可用的密码重置链接、83个API密钥、12个公开可访问的电子签名流程、7个完全可见的2FA备份码以及62个缺少过期约束的JWT。

Source-provided article image: The Silent Spill: Measuring Sensitive Data Leaks Across Public URL Repositories
Figure 1

Figure 1: Leak Detection Workflow Overview

· 第 2 页

深度剖析

作者构建了一个跨平台数据集,从五个公开来源(URLScan.io、VirusTotal、Wayback Machine、Hybrid Analysis、RedHunt粘贴站点)收集了约609万个URL,并设计了一套轻量级四阶段检测流程:词法过滤、内容获取、渲染与提取、内容分析。 此前关于URL泄露的研究多为小规模或聚焦单一来源,例如West与Aviv分析查询字符串披露、GitHound与SecretFinder检测代码仓库中的密钥,但未覆盖动态渲染或归档来源;本文首次将词法、结构与动态检查结合,跨扫描平台、归档与粘贴站点进行大规模测量。 数据集规模为6,094,475个URL,系统在3.8小时内完成端到端处理;Stage 1将数据缩减至832,714个候选,可用性检查后剩149,450个活跃URL,最终确认12,331个疑似泄露。

系统识别出12,331个疑似URL泄露,按类别分布为认证与令牌5,343个(43.3%)、财务2,412个(19.6%)、个人身份信息1,440个、元数据678个、旅行496个、社交308个、照片291个、电子签名60个、文档58个;其中URLScan.io贡献63.5%,Wayback Machine贡献14.6%。 此前没有大规模测量量化公开URL中敏感信息暴露的规模与类别分布;本文首次给出跨平台泄露的分类统计,并指出认证类泄露占主导。 对每个类别进行随机抽样人工验证,报告了假阳性率与Wilson 95%置信区间;例如认证与令牌类别假阳性率上限为0.26,据此估计约3,954个真阳性泄露。

作者报告了若干关键暴露类型:26个公开可访问的密码重置链接、83个出现在查询参数或内联内容中的API密钥、12个公开可访问的电子签名流程、7个完全可见的2FA备份码与16个部分遮蔽的备份码、62个缺少过期约束或有效期长达数天的JWT。 此前仅有新闻报道或博客提及此类暴露,本文首次通过自动化系统在大规模数据中系统性地识别并分类这些具体暴露类型,并检查了JWT的iat与exp声明。 这些发现来自对渲染页面、查询参数、DOM结构、隐藏输入字段与OCR提取内容的分析;作者对2FA与密码重置链接的行为进行了自控账户验证,确认访问不会使凭证失效。

作者对2,000个此前标记为泄露的URL进行75天后的自动回访,发现38%(762个)仍可在无需认证的情况下公开访问,并对其中200个进行分层人工验证,确认页面仍暴露敏感内容。 此前研究未测量URL泄露的时间持续性;本文首次提供泄露持久性的纵向数据,表明这些暴露并非短暂现象。 回访样本为2,000个随机抽样的URL,75天后762个仍可访问;人工验证了200个分层子集,确认内容仍为敏感信息而非占位符或错误状态。

启示与展望

该研究适用于公开可访问URL的被动检测场景,面向安全研究者、仓库运营方、企业安全团队与开发者。检测流程与标识符集已开源,可被仓库用于发布前自动脱敏,或被企业用于监控自身域名在公开源中的暴露。结果基于2025年1月至4月收集的数据,适用于扫描平台、归档与粘贴站点这三类公开来源。

真阳性与假阳性估计依赖类别内随机抽样并假设假阳性分布均匀,但某些域名(如重复登录模板)可能不成比例地贡献假阳性,域名层面的偏差可能影响估计。召回率因缺乏全面的已确认泄露标注数据集而难以大规模测量,系统覆盖率评估仍是开放问题。来源分布不均衡部分反映平台可访问性差异,URLScan.io提供广泛的自助访问,而其他仓库限制更严。此外,泄露模式与暴露格式可能随时间变化,平台结构更新与参数名演化可能影响检测效果。

来源