CIPO用反事实分支训练LLM智能体在原子工具与复合技能间自适应选择粒度,在三个基准和两个骨干上同时提升成功率与决策压缩
相关研究与后续进展核心概要
该工作提出CIPO框架:先用预算约束的BPE式挖掘从成功工具轨迹中抽取可执行复合技能,再在GRPO中对每条基础轨迹于首个可替换的粒度决策点构造反事实分支,用配对结果差作为有界补充奖励;在TOOLATHLON、TOUCAN、TRAJECT-Bench三个基准与Qwen2.5-7B、Llama3.1-8B两个骨干上,CIPO在全部六个设置取得最高Tool F1与TSR,平均Comp./Raw为0.845,优于GRPO+Skills的0.912,且提升并非来自单纯增加技能调用频率。
Figure 1 : Pilot analyses on tool-use granularity. (a) Successful TOOLATHLON trajectories contain recurrent tool patterns. (b) Looser mining constraints increase both the skill library size and candidate overlap, motivating budget-constrained skill construction. (c) Frequent subsequences often require runtime execution support, including parameter binding, candidate selection, dataflow handling, and failure recovery. (d) Granularity preference varies across states, while SFT and “GRPO + Skills" fail to follow the oracle trend, suggesting the need for explicit granularity training.
arXiv深度剖析
把“何时用原子工具、何时用复合技能”形式化为自适应工具粒度选择这一策略问题,并用试点分析给出依据:在考察的状态中技能更优占37%、原子工具更优占21%,其余相当,而SFT与GRPO+Skills的技能调用率都远离该oracle趋势。 此前记忆、工作流复用与工具合并方法多把复用过程当作上下文提示或固定指导,不改变动作空间,也很少训练状态相关的粒度选择。 证据来自对成功TOOLATHLON轨迹的试点统计(若干子序列出现超过100次;放宽挖掘约束会同时放大技能库规模与候选重叠),属于动机性分析而非因果实验。
提出预算约束的BPE式技能挖掘与可执行技能实例化:以工具名加参数键签名做抽象token,在最大合并轮数、最小对频次、最大模式长度约束下合并,并把候选注册为带参数暴露/内部管道、选择控制、执行轨迹与软中断的可调用技能。 相对直接合并工具或把子序列当固定流水线,该设计限制了技能库规模与候选长度(命题给出候选数不超过合并轮数、长度不超过上限),并让技能在运行时可检查、可恢复。 方法层面的构造与两个规模/长度上界命题;消融显示去掉预算挖掘或去掉可执行实例化都会降低平均F1与TSR(42.82/31.75与42.10/31.05,低于完整CIPO的48.23/36.48)。
提出CIPO:在GRPO基础上,对每条基础轨迹在首个可替换粒度决策点构造反事实分支,替换为另一粒度的可行动作并由同一策略续写,配对结果差经缩放与裁剪后作为有界补充奖励,任务奖励仍是主信号。 相对标准GRPO与GRPO+Skills,CIPO直接比较同一决策上下文下两种粒度的后果,而不是只给轨迹级结果奖励。 消融显示去掉反事实奖励(保留分支)平均F1/TSR为43.25/31.65,低于CIPO-first的48.23/36.48;分支点选择上CIPO-first优于CIPO-random(46.72/34.90)与CIPO-late(45.76/34.10)。
在三个基准与两个骨干的六个设置中CIPO均取得最高Tool F1与TSR,平均Comp./Raw为0.845,且技能使用率向覆盖率推导的参考水平上升,说明改进来自更好的粒度选择而非更多技能调用。 相对工具组合与技能构建基线(如AWO 0.86、LLMCompiler 0.93、SKILL0 1.00),CIPO在压缩更强的同时保持最高TSR。 主表覆盖六个基准-骨干设置;TSR为每设置100个episode、五次独立LLM评判的均值;严格yes-only评判中CIPO比GRPO+Skills高6.28个百分点,TOOLATHLON执行式评测中高7.50个百分点。
启示与展望
该结果面向具备可枚举原子工具、可挖掘成功轨迹并能注册技能接口的工具使用环境,适用于检索、文件访问、结构化处理与API式操作等长程任务;方法在推理阶段直接于增广动作空间选择动作,不进行反事实分支。对希望降低策略级决策数、同时保持任务完成的工程团队,CIPO提供了可复用的训练流程:预算约束挖掘控制技能库规模,可执行实例化保证技能在新状态下可运行,反事实分支提供状态相关的粒度反馈。作者也指出,在医疗、法律、金融或安全关键等错误工具执行可能造成实质伤害的场景,应配合人工审批、沙箱执行、工具权限控制、日志与领域安全检查,而非直接部署。
技能使用率参考值被作者明确界定为库级参考而非状态级最优策略,训练期在线rollout与最终评测轨迹属于不同分布,两者技能使用比例不必一致;反事实奖励被定位为有界补充信号而非独立因果估计。附录J的置信区间表与附录L.1的严格/执行式评测表在正文中未给出具体数值,因此这些补充证据的幅度只能从文字描述了解。此外,技能挖掘预算、奖励缩放与裁剪等超参数存在敏感性,迁移到新工具环境时其合适取值仍需重新校准。
