arXiv 2026年10月5日该工作系统研究了针对计算机使用代理(CUA)的分支引导攻击——攻击者通过构造不可信数据迫使代理进入预先批准的危险分支而无需注入显式指令,并提出 STEER-Bench(覆盖 9 个领域的 101 个任务)显示标准 CUA 攻击成功率达 94.4%、原始 Dual-LLM 达 89.5%,随后提出 COBRA 架构,将可信分支计划与事前能力约束配对,严格限定每个分支可执行的参数与目标,在 STEER-Bench 上把攻击成功率降至 0% 并保留 97% 的良性效用。该工作系统研究了针对计算机使用代理(CUA)的分支引导攻击——攻击者通过构造不可信数据迫使代理进入预先批准的危险分支而无需注入显式指令,并提出 STEER-Bench(覆盖 9 个领域的 101 个任务)显示标准 CUA 攻击成功率达 94.4%、原始 Dual-LLM 达 89.5%,随后提出 COBRA 架构,将可信分支计划与事前能力约束配对,严格限定每个分支可执行的参数与目标,在 STEER-Bench 上把攻击成功率降至 0% 并保留 97% 的良性效用。COBRA 架构将分支引导攻击成功率从 94.4% 降至 0%,同时保留 97% 良性效用该工作系统研究了针对计算机使用代理(CUA)的分支引导攻击——攻击者通过构造不可信数据迫使代理进入预先批准的危险分支而无需注入显式指令,并提出 STEER-Bench(覆盖 9 个领域的 101 个任务)显示标准 CUA 攻击成功率达 94.4%、原始 Dual-LLM 达 89.5%,随后提出 COBRA 架构,将可信分支计划与事前能力约束配对,严格限定每个分支可执行的参数与目标,在 STEER-Bench 上把攻击成功率降至 0% 并保留 97% 的良性效用。该工作系统研究了针对计算机使用代理(CUA)的分支引导攻击——攻击者通过构造不可信数据迫使代理进入预先批准的危险分支而无需注入显式指令,并提出 STEER-Bench(覆盖 9 个领域的 101 个任务)显示标准 CUA 攻击成功率达 94.4%、原始 Dual-LLM 达 89.5%,随后提出 COBRA 架构,将可信分支计划与事前能力约束配对,严格限定每个分支可执行的参数与目标,在 STEER-Bench 上把攻击成功率降至 0% 并保留 97% 的良性效用。