AVRI 通过持久双向证据追踪将 Codex 漏洞发现成本降低 18.0%、OpenCode 降低 23.7%
核心概要
该工作对 200 条 CyberGym 执行轨迹做多轴开放编码,发现代码定位与理解(43.1%)加漏洞推理与触发设计(17.3%)占 60.4% 的 token,且仅 24.4% 的配对比较能在更低总成本下保持成功;据此提出以持久双向证据追踪(BET)为核心的 AVRI 接口,在 20 个任务上使 Codex 总成本降低 18.0%、OpenCode 降低 23.7%,同时保持成功率并提升或维持召回率。
Figure 1 . RQ2. Mean token consumption per task by activity stage, for four agents and five configurations, ten tasks each. Bars count input plus output with cached input counted once, and include auxiliary model usage. Solid segments cover activity through the first observed PoC execution feedback, hatching covers activity after it, and dots mark traces in which no PoC execution feedback was observed. Textures indicate feedback timing; stage labels describe request purpose rather than newly generated reasoning. Horizontal stacked bar chart of mean tokens per task by activity stage for twenty agent and method groups, with code localization and understanding as the largest segment in most groups.
arXiv深度剖析
对四个 agent(Codex、OpenCode、Cybench、EnIGMA)在无辅助基线与四种效率方法下的 200 条 CyberGym 轨迹做多轴开放编码,量化了 token 消耗与失败瓶颈的分布。 此前工作分别针对历史压缩、假设排序、执行反馈或代码导航提出单点改进,但未在同一批执行轨迹上把方法效果与活动阶段、失败瓶颈对应起来。 32,924 个归一化请求按九个活动阶段编码;冻结自动标签后,在 200 条按比例抽样轮次上与人工共识一致率为 94%(188/200),在 100 条 H/L 边界案例上为 96%(96/100)。
代码定位与理解(L)占 43.1% token,漏洞推理与触发设计(H)占 17.3%,两者合计 60.4%;在 67 条失败轨迹中,H 贡献 27.0 单位失败权重、L 贡献 19.0 单位,合计 68.7%。 该结果把 token 份额与失败归因分开编码,显示两者排序不同:L 占更多 token,H 占更多失败权重,因此降低代码阅读成本与帮助 agent 解决触发条件是互补目标。 200 条轨迹共消耗 776.60M token,其中辅助模型 54.53M(7.0%);失败瓶颈按每条失败轨迹一个权重单位、在其支持类别间均分,权重描述观察到的阻塞而非因果贡献。
在 160 对增强–基线配对中,仅 39 对(24.4%)在两次运行都成功且增强运行成本更低;不适合的信号(59 对)与访问或使用限制(38 对)是最常见的编码限制,另有 7 对出现开销反转。 这给出了现有效率方法收益受限的具体机制分类,并指出辅助模型计费可能抵消主模型节省,因此需要按完整账单评估节省。 机制编码基于方法输出、后续 agent 动作与验证反馈,并以配对基线作对照;开销反转由计费记录判定,即主模型成本低于基线但含辅助调用的总成本更高。
AVRI 以持久双向证据追踪(BET)连接 harness 输入传播与不安全操作条件,在 20 个评估任务上使 Codex 总成本从 $132.65 降至 $108.75(18.0%)、OpenCode 从 $4.38 降至 $3.34(23.7%),成功率不变,召回率提升或维持。 在相同评估配置中,四种现有方法均未在两个 agent 上同时降低成本且不降低任一效果指标,AVRI 是唯一做到这一点的配置。 20 个任务与前期研究的 10 个任务不重叠;成功与召回由易受攻击构建与修复构建的提交记录导出,而非 agent 自报;时间与成本包含全部 20 次运行(含失败),并计入 Revelio 预处理与 AgentDiet 辅助调用。
启示与展望
该工作面向已给定 harness 入口点、目标程序与简要输入格式指引的漏洞发现场景:agent 仍需自行识别不安全操作并推导触发输入,范围不含攻击面选择与 harness 构建。AVRI 的适用前提是分析区域有界,作者明确表示不预期该设计原样迁移到开放式攻击面发现;C/C++ 内存安全缺陷比托管语言中的逻辑缺陷更适合长度、偏移这类约束原子。评估聚焦 Codex 与 OpenCode,因为前期研究发现 Cybench 与 EnIGMA 成功率明显更低且成本普遍更高。对读者而言,可直接复用的是活动阶段与失败瓶颈的编码框架、把辅助模型计费纳入总成本的核算方式,以及“返回相关代码同时保留输入值与不安全操作条件之间受支持关系”的接口思路。
失败瓶颈与方法机制两条轴各由单一作者编码,未评估编码者间一致性,因此类别分配与频次可能存在系统性解释偏差。RQ3 与第 5 节评估均为每个 agent、配置、任务一次运行,无法通过重复运行把方法效应与运行间方差分开;作者也指出缺少组件消融,无法隔离各机制的贡献。AVRI 的收益是否对运行间波动稳健、BET 的哪一部分带来节省,仍是待解问题。此外,AVRI 不是全程序验证器或符号执行器,分析会在未解析别名、不支持副作用、间接调用或歧义宏处停止,未映射的值保持未解析,不确定的调用目标使结果以该目标为条件;静态推导本身也不证明条件可满足或会产生可观察失败,仍需执行验证。
