跳到主要内容
返回时间线
arXiv来源发表:

CaptchaArena 用 2 万道可执行验证的验证码题训练出单一策略 CaptchaAgent,平均 Pass@1 从 11.4 提升到 71.7,人类为 94.1

核心概要

该工作构建了 CaptchaArena——一个包含 2 万道交互式验证码谜题、覆盖 20 种类型与五种交互模式的大规模细粒度计算机使用训练数据集,每道题的解答都经真实浏览器回放并由页面验证器接受,同时提供 2 万条截图-动作轨迹(其中 1.8 万条带经裁判过滤的逐步推理标注)以及针对不规则目标的像素掩码监督;基于该数据训练单一 90 亿参数策略 CaptchaAgent,监督微调后平均 Pass@1 达 70.5,再用环境验证器作为奖励做强化学习后升至 71.7,而未训练骨干为 11.4、最强开源 GUI 智能体为 35.2、最强闭源模型为 69.2、人类为 94.1。

AI-generated editorial illustration: CaptchaArena: A Large-Scale, Fine-Grained Dataset for Training Computer-Use Agents on Interactive CAPTCHAs

深度剖析

数据集把每道验证码题表示为一个可执行的浏览器任务,答案只有在回放被站点自身验证器接受后才被收录,从而把静态图像-答案对升级为闭环交互监督。 此前的验证码资源在类型覆盖、交互保真度与轨迹监督之间存在取舍:ReCAP 与 CaptchaMind 覆盖类型较少,MirrorCAPTCHA 的合成训练样本只提供答案与点击坐标监督,MCA-Bench 预测结构化解而非在真实浏览器中逐步执行,CAPTCHA-X 用人工定义的几何接受区域评分。 数据集含 2 万道谜题、覆盖 20 种类型与单点、多点、箭头轮换、实时、文本输入五种交互模式,训练/验证/测试分别为 1.6 万、2000、2000 道;每道题都有一条在真实浏览器中执行并通过页面验证器的参考解,因此每道题至少产出一条截图-动作轨迹。

对不规则目标采用像素掩码而非边界框评分,改变了所测得的定位能力。 论文用同一批已记录点击分别按掩码与按掩码的紧致边界矩形重新评分,发现矩形评分会接受落在目标之外但在矩形之内的点击。 在 Pick Area 上,掩码评分与矩形评分的接受面积比平均为 0.62(范围 0.37–0.89),矩形覆盖图像 65.1% 而掩码仅 38.8%;UI-TARS-1.5-7B 在该类型上由掩码下的 33.0 升至矩形下的 77.5,而矩形内均匀随机点击可得 61.6。

单一 90 亿参数策略在全部 20 种类型上共享同一套参数、工具模式与观测格式,无需按任务适配器或任务条件切换,即可超过规模更大的通用模型。 此前 MCA-Bench 训练的是任务专用 LoRA 适配器,而通用 GUI 智能体与闭源模型在验证码上表现参差。 CaptchaAgent 平均 Pass@1 为 71.7、Pass@5 为 86.8,提交率 97.9%;六个开源 GUI 智能体最高 35.2,三个闭源模型跨 49.4 至 69.2;Qwen3.5 家族从 9B 扩到 35B-A3B 平均分仍为 11.4,说明规模本身未缩小差距。

以环境验证器直接作为强化学习奖励,无需学习奖励模型或人工奖励标注,即可提升首次尝试的可靠性并迁移到两个外部基准。 监督微调遗留两类失败:策略不总是提交,动作也不总是精确到被验证器接受;GRPO 阶段针对这两点,并按谜题而非按类型挖掘难度以保留组内奖励方差。 RL 将平均 Pass@1 从 70.5 提升到 71.7(排除 Click Order 后为 2.1 分),20 种类型中 13 种改善;Pass@1 的增益(1.2)大于 Pass@5 的增益(0.8),与提升首轮可靠性而非扩展可解集合一致;外部基准 Open CaptchaWorld 由 47.2 升至 51.0,Halligan 由 13.6 升至 20.0。

启示与展望

该数据集面向在自托管环境中训练与评测计算机使用智能体,适用于需要闭环感知-动作、像素级定位与多步交互的验证码任务;由于环境确定性地验证最终页面状态,强化学习不需要学习奖励模型或人工奖励标签,这一设置可被复用于其他具有可执行验证器的交互式任务。对读者而言,可直接取用的是 2 万道谜题、每题的参考解与截图-动作轨迹、1.8 万条推理标注,以及不规则目标的像素掩码;论文同时说明推理标注依赖商用模型,视觉编码器保持冻结,动作是离散的,因此轨迹无法复现行为检测器所使用的鼠标轨迹信号。

论文报告人类在同一界面下平均 94.1,而策略为 71.7,剩余差距集中在少数类型:Place Dot、Dice Count、Patch Select 与 Slide Puzzle 四类合计占 23.6 分差距中的 19.5 分。失败被归为三类——不提交、定位薄弱、执行不稳定;其中 Dice Count 的监督策略提交率仅 54.4,接近一半回合在答案未被检查前即计为失败,因此该类型的 Pass@1 同时反映任务难度与不提交行为。Pass@1 与 Pass@5 的差距在 Slide Puzzle、Bingo 与 Pick Area 上超过 30 分,说明这些任务存在执行方差而非能力缺失。此外,训练与测试之间存在源图像复用:六种类型共享源图像(Image Matching 测试图像的 100%、Coordinates 的 100%、Dart Count 的 100%、Misleading Click 的 100%、Patch Select 的 100%、Rotation Match 的 100%),论文以内容哈希审计并说明复用不等于谜题重复,但读者在解读泛化结果时仍需将其纳入考量。外部基准的分数与已发表结果不可直接比较,因为交互与评测协议不同。

来源