跳到主要内容
返回时间线
arXiv来源发表:

CITA 用贝叶斯工具图模拟器与 LLM 比较判断训练比较推理模型,在三个工具使用基准和多个主干 LLM 上一致提升 Tool F1 与任务成功率

相关研究与后续进展

核心概要

该工作提出面向工具使用智能体的比较推理方法 CITA,训练比较推理模型 CIM,从观测到的工具行为、贝叶斯工具图模拟器的可扩展监督以及基于 LLM 比较的语义判断组成的成对信号中学习,估计当前上下文下某个候选下一步工具调用支持最终任务成功的可能性;在三个工具使用基准和多个主干 LLM 上,CITA 一致提升 Tool F1 与任务成功率,分析显示 CIM 能学到用于比较工具选择的准确步骤级价值估计。

Source-provided article image: Choosing Before Acting: Comparative Value Estimation for Long-Horizon Tool-Use Agents
Figure 1 ·

Figure 1: Pilot analysis on long-horizon tool-use tasks. (a) Task success drops sharply as the required number of tool invocations increases. (b) Most failed trajectories remain unrecoverable even after several backtracking steps. (c) At many fork points, the model-preferred tool is not the tool with the higher empirical success rate under the same context. These patterns motivate comparative value estimation for possible next-tool choices before execution.

arXiv

深度剖析

提出 CITA,把工具使用智能体的决策目标表述为在执行前估计候选下一步工具调用的长时程价值,并训练比较推理模型 CIM 输出该候选调用在当前上下文下支持最终任务成功的可能性。 相对于依赖最终结果奖励或步骤级奖励的既有做法,该工作把监督信号明确放在同一上下文下不同候选调用之间的比较上,而不是只对已执行动作打分。 摘要说明 CITA 在三个工具使用基准和多个主干 LLM 上一致提升 Tool F1 与任务成功率,并给出 CIM 学到准确步骤级价值估计的分析结论;具体数值、基准名称与模型清单未在摘要中给出。

设计成对监督信号的组合方式:观测到的工具行为、来自贝叶斯工具图模拟器的可扩展监督,以及基于 LLM 比较的语义判断。 针对日志轨迹只包含实际执行调用、缺少反事实候选监督的问题,该工作用模拟器提供可扩展监督并用 LLM 比较补充语义判断,从而构造出同一上下文下的成对信号。 摘要明确列出这三类信号来源,并说明其用于训练 CIM;摘要未给出模拟器规模、LLM 比较的具体配置或消融结果。

在多个主干 LLM 上验证 CITA 的通用性,并报告 Tool F1 与任务成功率的一致提升。 相对于只在单一模型或单一基准上报告结果的做法,该工作在三个工具使用基准和多个主干 LLM 上给出跨模型、跨基准的一致性证据。 摘要给出跨三个基准与多个主干 LLM 的一致提升结论;未提供具体提升幅度、置信区间或统计检验信息。

启示与展望

该工作面向长时程工具使用智能体,适用于需要在执行前评估候选下一步工具调用价值的场景,例如多步工具调用任务中的动作选择与训练信号构造。其方法依赖成对监督信号,包括观测到的工具行为、贝叶斯工具图模拟器提供的可扩展监督以及基于 LLM 比较的语义判断,因此适用于能够构造或模拟候选调用比较的设定。摘要报告的结果覆盖三个工具使用基准与多个主干 LLM,说明该思路在这些评测范围内具有可复现的改进方向;对希望减少人工或额外 rollout 监督成本的智能体研究者与工程实践者,CITA 提供了以比较推理模型替代直接步骤标注的一条路径。

摘要未给出具体提升幅度、基准名称、主干 LLM 清单、贝叶斯工具图模拟器的构建方式与规模,也未说明 LLM 比较判断的提示设计与一致性控制。CIM 学到的步骤级价值估计的准确度以何种指标衡量、在何种条件下会退化,摘要仅以分析结论形式提及。由于本次阅读范围仅为摘要,未包含正文图表与实验细节,上述内容属于需要进一步阅读原文才能确认的开放问题。

来源