跳到主要内容
返回时间线
arXiv来源发表:

把智能体技能写成图:GraphSkillEvo 用进化搜索优化可复用的流程知识

核心概要

该工作把 LLM 智能体的技能表示为图结构的自然语言产物(节点为执行步骤及其操作指引,有向边编码依赖上下文的步骤转移),并在此基础上提出基于种群的进化优化框架 GraphSkillEvo,用全局指引变异、图结构变异、全局指引交叉、图结构交叉四个算子迭代搜索技能,在五个智能体基准、两个 LLM 与两种执行环境下平均优于技能优化基线 SkillOpt(GPT-5.4-nano 上 +4.01%,GPT-5.4 上 +1.76%),且总优化 token 消耗更低。

AI-generated editorial illustration: GraphSkillEvo: Evolutionary Optimization of Graph-Structured Agent Skills

深度剖析

提出把智能体技能写成图结构的自然语言产物:每个节点是一个执行步骤及其自包含的操作指引,有向边由工作流中的相邻节点定义,表示在特定适用条件下步骤之间的转移。 此前技能优化方法(如 SkillOpt)把技能表示为无结构的自然语言指令,作者指出这类表示缺少显式的工作流级指引、冗余较多,且搜索空间庞大;图结构把执行步骤与依赖显式组织起来,使共享指令可在多个工作流中复用一次。 论文给出形式化定义(全局指引、节点集、边集与工作流),并说明低冗余、显式工作流指引、更紧凑搜索空间三点性质;同时用校验脚本保证生成技能符合图模式,未通过校验的技能被丢弃并重新生成。

提出 GraphSkillEvo:基于种群的进化计算框架,用四个结构感知算子(全局指引变异、图结构变异、全局指引交叉、图结构交叉)在结构化技能空间中搜索,并按适应度在验证集上做种群选择。 相比纯 LLM 迭代式自我精炼(SkillOpt 的补丁式更新加验证门控),种群与交叉机制让不同搜索轨迹上发现的有效组件可以互相组合,从而扩大探索范围。 论文给出完整流程:种群初始化、训练集小批量执行并保留失败轨迹作为反思信息、按轮转调度选择算子、按适应度排名概率选择父代、在完整验证集上评估并保留最优个体,重复若干代后返回最优技能。

在五个基准(SearchQA、SpreadsheetBench、DocVQA、LiveMathematicianBench、ALFWorld)、两个 LLM(GPT-5.4、GPT-5.4-nano)与两种执行环境(无 harness、Codex harness)上,GraphSkillEvo 在 14 个设置中 13 个取得最佳结果,平均优于 SkillOpt。 相对无技能执行,平均成功率提升 15.37%(GPT-5.4 无 harness)、21.86%(GPT-5.4-nano 无 harness)、10.31%(GPT-5.4 Codex harness);相对 SkillOpt 分别提升 1.76%、4.01%、1.33%。 结果为三次重复技能优化运行的平均测试集成功率;作者报告程序性基准增益最大(SpreadsheetBench 相对 SkillOpt +10.60%,ALFWorld +3.73%),并给出单侧 Welch t 检验:Spreadsheet 与 ALFWorld 的 p 值低于 0.05,SearchQA 与 DocVQA 落在 0.05 至 0.10 区间。

消融与迁移分析支持图结构本身的价值:去掉图结构、去掉变异、去掉交叉都会降低平均表现,且用 GPT-5.4-nano 优化出的技能迁移到 GPT-5.4 后仍优于无技能基线。 这区分了“表示形式”与“搜索机制”两类贡献:去掉图结构后平均从 71.52 降到 64.08,说明仅靠种群进化不足以替代结构化表示;去掉变异降到 54.50,去掉交叉降到 66.59。 消融在 GPT-5.4-nano 上取三次重复实验平均;执行侧对照把图结构技能改写为保留全局指引与节点指令的无结构版本,五个基准分别下降 4.52、2.50、4.19、1.35、0.75 个百分点;迁移实验中 SpreadsheetBench 上迁移后的 GraphSkillEvo 技能达 71.78,高于其直接优化版本 69.40 与迁移的 SkillOpt 技能 53.21。

启示与展望

该结果面向以自然语言技能提升 LLM 智能体任务成功率的场景,适用于事实型问答、表格操作、文档视觉问答、数学选择题推理与具身交互这五类基准,并在无 harness 与 Codex harness 两种执行设定下验证;优化只改技能文本,模型参数与执行 harness 保持固定。对希望复用流程知识的读者,其价值在于技能可跨模型迁移:用 GPT-5.4-nano 优化出的技能在 GPT-5.4 上仍优于无技能基线。作者提出的后续方向包括与参数化优化方法结合、扩展更丰富的图组合机制,以及合并来自不同领域的图结构技能。

需要留意的是,增益在不同基准上并不均匀:程序性基准(SpreadsheetBench、ALFWorld)的差异达到统计显著,问答类基准(SearchQA、DocVQA)的 p 值落在 0.05 至 0.10 区间,而 LiveMath 在 GPT-5.4-nano 上 GraphSkillEvo 反而低于 SkillOpt 0.80 个百分点。此外,ALFWorld 在 Codex harness 下留空,因为该基准需要持续的环境交互,标准 Codex 适配器不支持;token 消耗也并非每个基准都更低(如 ALFWorld 上 GraphSkillEvo 消耗更多)。这些都属于适用范围与后续验证的开放问题,而非结论的否定。

来源