arXiv 2026年10月5日该工作提出面向工具使用智能体的比较推理方法 CITA,训练比较推理模型 CIM,从观测到的工具行为、贝叶斯工具图模拟器的可扩展监督以及基于 LLM 比较的语义判断组成的成对信号中学习,估计当前上下文下某个候选下一步工具调用支持最终任务成功的可能性;在三个工具使用基准和多个主干 LLM 上,CITA 一致提升 Tool F1 与任务成功率,分析显示 CIM 能学到用于比较工具选择的准确步骤级价值估计。该工作提出面向工具使用智能体的比较推理方法 CITA,训练比较推理模型 CIM,从观测到的工具行为、贝叶斯工具图模拟器的可扩展监督以及基于 LLM 比较的语义判断组成的成对信号中学习,估计当前上下文下某个候选下一步工具调用支持最终任务成功的可能性;在三个工具使用基准和多个主干 LLM 上,CITA 一致提升 Tool F1 与任务成功率,分析显示 CIM 能学到用于比较工具选择的准确步骤级价值估计。CITA 用贝叶斯工具图模拟器与 LLM 比较判断训练比较推理模型,在三个工具使用基准和多个主干 LLM 上一致提升 Tool F1 与任务成功率该工作提出面向工具使用智能体的比较推理方法 CITA,训练比较推理模型 CIM,从观测到的工具行为、贝叶斯工具图模拟器的可扩展监督以及基于 LLM 比较的语义判断组成的成对信号中学习,估计当前上下文下某个候选下一步工具调用支持最终任务成功的可能性;在三个工具使用基准和多个主干 LLM 上,CITA 一致提升 Tool F1 与任务成功率,分析显示 CIM 能学到用于比较工具选择的准确步骤级价值估计。该工作提出面向工具使用智能体的比较推理方法 CITA,训练比较推理模型 CIM,从观测到的工具行为、贝叶斯工具图模拟器的可扩展监督以及基于 LLM 比较的语义判断组成的成对信号中学习,估计当前上下文下某个候选下一步工具调用支持最终任务成功的可能性;在三个工具使用基准和多个主干 LLM 上,CITA 一致提升 Tool F1 与任务成功率,分析显示 CIM 能学到用于比较工具选择的准确步骤级价值估计。