跳到主要内容
返回时间线
arXiv来源发表:

AdvSim2Real 在冻结网页世界模型中协同进化任务、注入攻击与执行器,使 4B 智能体在未见前沿攻击者下完成率相对提升 33.6%

核心概要

AdvSim2Real 在一个冻结的网页世界模型内让任务课程、注入攻击者与网页执行器三者协同进化:课程因执行器约半数成功的任务获得奖励,攻击者仅因把一次判定成功翻转为失败而获得奖励;训练后的 4B 执行器在 150 个网页任务上干净完成率由 74.89% 升至 81.33%,面对三个已学习攻击者由 48.07% 升至 57.48%,面对未参与训练的 Kimi-K3 由 23.00% 升至 30.72%。

AI-generated editorial illustration: AdvSim2Real : Training Web Agents Against Adaptive Prompt Injection in a Web World Model

深度剖析

提出 AdvSim2Real 两阶段框架,在冻结的 WebWorld-14B 世界模型内协同进化任务课程、注入攻击者与执行器,使任务与攻击都跟随当前智能体水平变化。 此前的防御在训练前固定的注入样本上微调,攻击者无法适应被训练模型;此前的对抗训练虽让攻击者适应,却保持任务固定,任务一旦被解决便不再提供学习信号。 论文给出算法流程与两阶段交替更新设定,并在 150 个表单填写任务、五个技能层级上评估,报告了逐种子计数与检查点序列。

提出 success-flip 奖励:把一次被判定为成功的干净运行回放到注入步,仅当续跑失败时攻击者才得分。 若按执行器任何失败给奖励,攻击者会因执行器本就失败的任务获利;该奖励把攻击者信用限定为注入造成的成功翻转。 论文给出奖励公式、渲染门控与配对控制设计,并说明畸形提案得零分、不可达转移不产生注入与翻转信用。

发布 150 个表单填写网页任务基准,含五个技能层级、受保护字段与禁用控件、反应式攻击者以及提交表单的确定性浏览器检查。 该基准把任务契约、受保护字段、禁用控件与确定性检查一并提供,并随代码、检查点与轨迹发布。 论文列出十个模板、五个技能层级、低/高难度层与短/全表单的构成表,并说明浏览器严格成功需满足字段匹配、受保护字段未变、禁用控件未触发及必要复核。

给出课程阶段买能力、对抗阶段买鲁棒性的证据:去掉课程阶段后最终智能体干净完成率低 4.67 分,而受攻击完成率仅低 0.44 分。 该消融把两阶段流水线与仅第二阶段流水线对比,显示干净能力差距明显而受攻击差距不明显。 论文报告三轮消融的干净与受攻击均值及逐轮差值,并说明该消融同时移除执行器与课程初始化且未匹配算力,衡量的是两条流水线而非单独课程。

启示与展望

该工作面向需要任务保持型鲁棒性的网页智能体提供方:执行器在页面含竞争指令时仍完成授权目标。方法在冻结的 WebWorld-14B 世界模型内训练与评分,攻击结果均为该模型内的判定;能力检查点另在真实 Chromium 浏览器中以确定性表单检查验证,严格成功由 25.56% 升至 44.44%,正确字段由 52.50% 升至 73.24%。基准为 150 个表单填写任务、五个技能层级,含受保护字段与禁用控件。作者发布代码、基准与全部检查点结果,便于在适应被防御智能体的攻击者下评估注入防御。

世界模型可能显示执行器从未输入的值,判定器也可能接受错误计算,因此判定层面的鲁棒性增益尚不等同于可执行任务完成率的增益;只有能力检查点在浏览器中验证。训练攻击者从初始页面提案,而评估攻击者随轨迹反应,匹配攻击者检查点匹配的是攻击者而非具体攻击。评估用三个 rollout 种子衡量 rollout 方差而非训练方差,未报告置信区间。消融同时移除执行器与课程初始化且未匹配算力,因此未单独确立课程阶段带来的鲁棒性收益。作者指出,最终检查点面对前沿模型攻击者仍至少损失若干干净完成率,且所有鲁棒性数字都是单一世界模型内的模型判定。

来源