ControlScope 用同一执行状态对比三种修订权限:扩大改写范围在文件系统任务上多解 2–3 题,但也会打断已可行的续写
核心概要
ControlScope 在相同的公开执行状态下比较三种嵌套的修订权限——继续当前程序(Keep)、只改下一次工具调用的数据参数(Arg)、以及替换未完成的工作流(Full)——在文件系统任务、ALFWorld 与 AppWorld 上评估一次性与持续评审,发现 Full 在 20 个文件系统任务上以两个源程序与三次推理评审抽样完成 15–16 题而 Keep 为 13 题,四次快速抽样则为 10–13 题对 13 题,ALFWorld 快速面板在 87 个任务上得分为 85/86/87、在 134 个任务上为 134/134/127,AppWorld V1 官方测试 585 个任务实例的净差异很小,同时冻结回放显示可行的智能体自写替换会被后续修订打
深度剖析
论文把“可用的修复”与“智能体实际选择的修复”分开:Keep、Arg、Full 是嵌套权限集合,Full 包含所有更小范围的操作,因此更大集合上的损失反映的是部署的选择与执行策略,而不是权限本身。 既有工作如 GraSP 比较过类型化的局部修复与全局重规划,也有关注频繁改计划与执行一致性张力的先行研究;本文的增量是把权限范围做成嵌套操作集,并从同一公开执行状态出发记录“授予范围”与“实现范围”。 在 20 个文件系统任务、每任务两个源程序、三次推理评审抽样下,Full 完成 15–16 题而共享的 Keep 为 13 题;四次快速抽样为 10–13 题对 13 题,说明源程序与评审抽样共同决定哪些任务受益。
扩大修订范围能修复具体的程序缺陷:批量读取与解析器修复。 论文给出机制级证据而非仅总分:一个保留的批量读取替换在 94 次调用后达成目标,而原循环在 100 次调用预算内未完成,两者共享前 88 次调用;另一源程序在 28 次调用时完成,前缀为 26 次调用。 学生记录任务中 19 名被选学生经全部原始记录独立核对;解析器修复对全部 150 名学生产生正确结果;在 25/75/150 名学生的子集上两种评审模式均为 5/6、5/6、6/6,并在三个新子集与两个新源程序上重复得到 5/6、5/6、6/6。
后续评审会打断已经可行的续写,而保留首次修订的两种规则都没有带来面板级收益。 论文用冻结回放把“候选本身可行”与“它是否被允许跑完”分开:文件时间分类任务中第一个源程序 71 次实际替换有 49 次在保留到块端点或原调用预算时满足目标,第二个源程序为 62 次中的 46 次。 在 P2 自动工具快速面板与第一次 P2 推理抽样的全部替换型运行中,持续修订成功 5/10 与 9/13,只保留首次修订为 4/10 与 7/13,零配对增益、三次损失;五调用保护在 20 个新源程序上节省 19.4% 记录输出并损失一次成功。
评审时机与有效操作返回率共同决定任务成功与模型工作量,而不只是权限范围。 论文把评审调度、无效评审回退与令牌开销纳入同一评估:87 任务推理面板中 Full 比 Keep 多两个终局成功,但输出令牌为 29.7 倍;Arg/Full 分别记录 51/16 次无效评审回复并保留在得分中。 在 87 任务推理面板上初始计划成功为 79/81/85,经普通恢复后为 85/86/87;Full 使用 1,124 个动作对 Keep 的 1,336 个,普通修复调用 2 次对 17 次;同一快速协议下 134 任务队列为 134/134/127,方向相反。
启示与展望
这项工作面向在既有智能体循环内控制一个未完成程序的场景:每个条件都保留普通规划,ALFWorld 各条件还保留相同的普通失败恢复流程,因此比较的是对已生成程序的控制,而不是整体智能体能力。它适用于文件系统类 MCP 任务、ALFWorld 家务计划与 AppWorld 官方测试面板,并明确给出各自的执行契约、调用预算与评审配置。对设计者而言,可直接使用的结论是同时暴露数据参数编辑与工作流替换,并把评审时机与有效操作返回率纳入评估;批量读取与解析器修复这两类机制说明了更宽权限在何处产生价值。
结果对源程序与评审抽样敏感:同一任务的两个源程序可能一个受益一个不受益,四次快速抽样从少三题到持平。ALFWorld 两个固定队列方向相反,87 任务队列 Full 多两题,134 任务队列 Full 少七题,因此不能把单一队列的方向当作普遍结论。AppWorld V1 的 Full 替换会续期 250 次请求的块配额,这一额外容量有利于 Full,其观测差异混合了修订范围与容量。本地早期边界上 216 对 Arg 与 Full 终局完全相同,说明该固定边界处的配对相等不能外推到持续策略。打断证据仍是案例级:两种保留规则都没有面板级增益。此外,若干结果受服务错误与上下文上限影响,例如 12 次服务错误全部来自同一个超限上下文,排除该状态后 Arg–Full 差异仍为零。
