arXiv 2026年10月6日该工作提出CIPO框架:先用预算约束的BPE式挖掘从成功工具轨迹中抽取可执行复合技能,再在GRPO中对每条基础轨迹于首个可替换的粒度决策点构造反事实分支,用配对结果差作为有界补充奖励;在TOOLATHLON、TOUCAN、TRAJECT-Bench三个基准与Qwen2.5-7B、Llama3.1-8B两个骨干上,CIPO在全部六个设置取得最高Tool F1与TSR,平均Comp./Raw为0.845,优于GRPO+Skills的0.912,且提升并非来自单纯增加技能调用频率。该工作提出CIPO框架:先用预算约束的BPE式挖掘从成功工具轨迹中抽取可执行复合技能,再在GRPO中对每条基础轨迹于首个可替换的粒度决策点构造反事实分支,用配对结果差作为有界补充奖励;在TOOLATHLON、TOUCAN、TRAJECT-Bench三个基准与Qwen2.5-7B、Llama3.1-8B两个骨干上,CIPO在全部六个设置取得最高Tool F1与TSR,平均Comp./Raw为0.845,优于GRPO+Skills的0.912,且提升并非来自单纯增加技能调用频率。CIPO用反事实分支训练LLM智能体在原子工具与复合技能间自适应选择粒度,在三个基准和两个骨干上同时提升成功率与决策压缩该工作提出CIPO框架:先用预算约束的BPE式挖掘从成功工具轨迹中抽取可执行复合技能,再在GRPO中对每条基础轨迹于首个可替换的粒度决策点构造反事实分支,用配对结果差作为有界补充奖励;在TOOLATHLON、TOUCAN、TRAJECT-Bench三个基准与Qwen2.5-7B、Llama3.1-8B两个骨干上,CIPO在全部六个设置取得最高Tool F1与TSR,平均Comp./Raw为0.845,优于GRPO+Skills的0.912,且提升并非来自单纯增加技能调用频率。该工作提出CIPO框架:先用预算约束的BPE式挖掘从成功工具轨迹中抽取可执行复合技能,再在GRPO中对每条基础轨迹于首个可替换的粒度决策点构造反事实分支,用配对结果差作为有界补充奖励;在TOOLATHLON、TOUCAN、TRAJECT-Bench三个基准与Qwen2.5-7B、Llama3.1-8B两个骨干上,CIPO在全部六个设置取得最高Tool F1与TSR,平均Comp./Raw为0.845,优于GRPO+Skills的0.912,且提升并非来自单纯增加技能调用频率。