跳到主要内容
返回时间线
arXiv来源发表:

EdgeGen 从智能体政策文档中抽取合规规则并生成违反规则的数据库落地任务,在 tau2-bench 航空域把微调平均进度提升 2% 至 42%,并让 Gemma-4-e4b 的 harness 优化相对基线提升 30%

核心概要

EdgeGen 从智能体的政策文档中自动抽取合规规则,枚举规则违反组合,并用场景感知的 SQL 智能体把每个场景落到可执行的数据库状态上,再经数据落地与场景可行性双重校验后生成任务;与合成数据库生成方法组合后形成无需人工标注的闭环流水线,在 tau2-bench 航空域上微调带来 2% 至 42% 的平均进度提升,而部分基线方法在部分模型上出现退化,harness 优化在 Gemma-4-e4b 上相对人工整理与基线 harness 分别提升 10% 与 30%。

AI-generated editorial illustration: EDGEGEN: Improving Tool-Calling Agents Beyond Happy Paths with Synthetic Edge Case Generation

深度剖析

提出以“违反规则”为驱动的合成任务生成框架 EdgeGen:从智能体规范中抽取合规规则,对规则集合做幂集枚举构造违反场景,再用场景感知的 SQL 智能体采样使任务可行的数据库取值,最后经数据落地与场景可行性两道校验才接纳任务。 既有合成任务生成方法(如 TaskBench、FuncBenchGen)多生成通用函数调用任务,不系统枚举行为规则违反空间,也不以数据库状态为落地依据;EdgeGen 把“何时应当拒绝”这一维度显式纳入任务构造。 论文给出五阶段流水线描述(工具图构建与路径采样、违反场景生成、场景感知数据库采样、测试用例生成、验证),并说明验证由 SQL 智能体执行确定性 SQL 查询完成;规则抽取质量经人工比对审计,航空域精确率 90.0%、召回率 87.5%、F1 88.7%,零售域 100.0%/95.2%/97.6%,ToolSandbox 100.0%/100.0%/100.0%,总体 94.6%/92.1%/93.3%。

把合成数据库生成、EdgeGen 任务构造与基于合成数据的智能体优化串成完全自动化闭环,无需生产日志、人工标注任务或真实数据,即可在人工整理的测试集上取得提升。 既有智能体评测基准各自提供固定测试用例,不提供自动扩展评测以支持智能体改进的合成数据层;该闭环把环境状态、任务生成与优化连成一体。 论文报告在 tau2-bench 航空域与 ToolSandbox 上使用监督微调与 harness 优化两类优化方式;微调数据来自 gpt-5.4 作为智能体模型、每个样本 8 次试验共 120 条 rollout,仅保留进度率为 1 的成功轨迹用于监督微调。

在 tau2-bench 航空域上,EdgeGen 生成数据的微调对全部被测模型均带来提升,而人工整理数据与 TaskBench 在部分模型上反而退化。 论文据此提出覆盖度假设:不含违反场景、覆盖较窄的任务不足以支撑策略合规行为,甚至可能有害;EdgeGen 显式最大化合规规则组合的覆盖。 论文报告微调带来 2% 至 42% 的平均进度提升;人工整理数据在 6 个模型中有 3 个退化(gemma-4-e2b 最多下降约 8 个百分点),TaskBench 在 6 个模型中有 4 个退化;聚合胜率表显示 EdgeGen 对 Base 胜率 100.00%、对 Naive 81.25%、对 Human-Curated 86.67%、对 TaskBench 94.12%、对 FuncBenchGen 100.00%,论文说明这是描述性比较而非显著性检验。

同一批 EdgeGen 样本可用于黑盒模型的 harness 优化:Gemma-4-e4b 上平均进度从 0.43 提升到 0.56,相对基线 harness 提升 30%、相对人工整理数据优化的 harness 提升 10%,且工具调用与 token 消耗更少。 论文通过案例研究指出,人工整理训练集集中在“批准分支”工作流,优化后的系统提示变成逐条硬编码业务规则的清单;EdgeGen 训练集把一半预算分配给拒绝与核验类场景,优化后的提示收敛为 discover→verify→confirm→write 四步协议,引用政策文档与工具描述而非内联枚举。 表 2 报告 Gemma-4-e4b 基线 harness 平均进度 0.4301、人工整理优化 0.5083、EdgeGen 优化 0.5608,工具调用 5.8/8.8/6.9,token 81.0k/121.0k/85.0k;gpt-5.4 上 EdgeGen harness 与人工整理优化在平均与最大进度上相差 2% 至 4%,但工具调用与 token 更少;ToolSandbox 上 gpt-4o-mini 的 EdgeGen 优化平均进度 0.923,低于人工整理的 0.931,且 token 与工具调用增加。

启示与展望

该结果面向拥有结构化政策文档与关系型数据库的企业工具调用智能体开发场景,可用于两类下游用途:一是用生成的轨迹做监督微调,二是对无法微调的黑盒模型做 harness 优化。论文说明 EdgeGen 对数据库来源不敏感,可使用任何兼容的关系型数据库,因此合成数据库生成与任务生成可以解耦替换。适用对象主要是中小规模模型,论文观察到提升在 Qwen 2.5-3b 与 Gemma 系列上更明显,而在测试集上已接近饱和的更大模型上空间更小。

论文自述评测规模有限,主实验每个基准仅 10 至 15 个评测场景,补充的规模实验使用 21 个航空场景,更大评测集与更广基准套件仍待补充。复杂度消融显示提升并非随违反数量单调:Qwen2.5-3b 在 1 个违反时最大进度 0.67,2 个与 3 个违反时降至 0.24 与 0.38,其中 2 个违反低于 0.35 的基线。数据规模实验显示人工整理测试集平均进度在 30 个任务时最高,60 个任务时回落,且合成验证集上的改善并不稳定地迁移到人工整理测试集。人工研究抽查中,标记成功的运行里航空域 6/10、ToolSandbox 4/10 被核实为正确,其余涉及断言过松、判定错误或任务细节缺失;失败运行多数归因于智能体自身局限,少数来自任务或数据生成。论文还指出验证步骤不保证每条抽取规则或断言在语义上正确,且规则抽取依赖结构化政策文档。上述均为范围与开放问题,读者可据此判断结论适用的边界。

来源