跳到主要内容
返回时间线
arXiv来源发表:

让工具自己报告进度:智能体工具调用已持有进度信息,服务系统应当读取它

核心概要

该工作提出让运行中的工具调用显式报告自身进度(剩余工作量或临近结束信号),通过对四个公开智能体语料库的普查、一个不改变智能体可见输出的采集框架、与四个已发表预测器的对比,以及在 vLLM 中通过少量提示接入的端到端评测,发现所报告进度在 KV 缓存决策点上比最佳已发表预测器准确数倍至一个数量级,并在环境变化时保持准确,使工具调用后的 p90 首 token 时间相对 LRU 降低 20.7%(仅 HBM)与 20.8%(HBM + DRAM),接近 oracle 水平。

Source-provided article image: Ask the Tool, Don't Guess: Agent Tool Calls Hold Their Progress, and the Serving System Should Read It
Figure 12 ·

Figure 12. Median absolute ETA error at 50 % and 90 % of the call, as a share of the call’s own duration, pooled over tests, builds and instrumented scripts. Rows are the load condition of the running call. Each history column shows the best method given the history source (idle, mild, high, mixed); the last column is the progress stream. Each call replayed under the four conditions.

arXiv

深度剖析

论文指出,在调用开始前固定的时长估计无法知道调用时长,甚至可能无法对长调用排序;而运行中的工具本身已持有答案。 相对以往依赖工具名、历史、预先声明时长或引擎占用的做法,论文把现有计时信号整理成一张“阶梯”表,并给出证据说明每一级都在调用开始前固定估计或从未看到调用内部。 证据来自对排行榜运行、OpenHands 评测运行与自有运行的复现:同一命令在空闲沙箱上快一个数量级,加入繁忙邻居后多数调用慢数倍,生产负载下长调用的顺序与空闲机器上的顺序无相关性。

论文给出首个语料库规模的智能体工具调用进度普查,把工具持有的信息分为强信号(剩余工作量比例或已知总数下的计数)与弱信号(仅准确表明临近结束),并归纳出四种来源。 此前没有对工具调用内部可读进度的系统性统计;论文报告了每类信号在工具时间中的占比以及揭示它们所需的代价。 普查覆盖四个公开语料库,按来源、脚手架、命令类别与时长分层,由两个前沿语言模型标注、第三个模型仲裁分歧,并用人工标注子集校验;应用全部工具后,强信号覆盖排行榜工具时间的 38%、OpenHands 的 51%、自有运行的 48%,弱信号将这一比例提升至 66%、59%、72%。

论文构建了一个采集框架,在不改变智能体所见内容的前提下,把工具输出与工具在磁盘上的痕迹合并为一条进度事件流。 相对以往需要改变智能体观察或依赖预先声明时长的方案,该框架通过侧信道传递进度,保持结果路径逐字节不变,并处理计数器超过总数、多阶段折叠等可信性问题。 在 SWE-bench Verified 任务样本上,侧信道配置未显著改变智能体得分,步数、token、工具时间与墙钟时间也均未改变;两层读取合计给真实调用增加的墙钟时间不到百分之一。

论文在 KV 缓存决策点上比较所报告进度与四个已发表预测器,并在生产引擎中端到端测量其收益。 相对以往在固定大小沙箱上测量预测误差的工作,论文在调用中点与临近结束两个决策点评估,并覆盖环境变化、不同基座模型与说谎会话的情形。 在调用 50% 处,进度流的中位误差约为调用时长的五分之一,最佳历史预测器为三分之一;在 90% 处,进度流中位误差低于 10%,最佳历史预测器为 80%;在 4×H100 SXM 上回放,工具调用后 p90 TTFT 相对 LRU 降低 20.7%(仅 HBM)与 20.8%(HBM + DRAM),oracle 分别降低略超四分之一与 23%。

启示与展望

该结果面向在工具调用期间需要决定 KV 缓存去留与回归的 LLM 服务系统,适用于编码智能体常见的安装、构建、测试套件与生成脚本等长调用场景;论文同时给出会话信用机制,把工具报告视为不可信输入,使说谎最多只能失去收益而不影响诚实会话。论文呼吁工具以自选形式暴露自身状态,届时无需开关、dry run 或解析器,采集框架只需转发。

论文自述三类边界:部分工具调用不持有可读信息(只在结束时应答的远程 API、等待人工反馈的命令、首字节前就停滞的下载);部分信息无法解析(未见过的输出格式、隐藏单位的构建系统、用自己措辞报告的脚本);以及为取出信号而做的开关、dry run 或插桩脚本本身是对工具运行方式的改变,每个新工具都需重新测量。此外,负载在调用中途被移除时,进度流在观察到新速率前会高估剩余时间,窗口化速率可缩短这一滞后;说谎会话的信用机制结果来自初步模拟。

来源