LEAP 用 0.6B 草稿模型学习目标动作序列,让 LLM 智能体端到端提速最高 60% 且任务成功率无系统性变化
相关研究与后续进展核心概要
作者提出一个用于动作推测回合的延迟框架,把一轮推测的收益(草稿模型对目标模型的预测准确度、任务在结束前可执行的步数)与成本(起草、等待目标模型验证、执行工具)相比较,并据此设计 LEAP:保持草稿模型很小(0.6B),通过在目标动作序列上训练使其与目标模型决策高度一致,从而在多种数据集、目标模型和草稿模型上实现最高 60% 的端到端墙钟时间加速,且任务成功率无系统性变化;草稿模型还可在无预先轨迹收集的情况下在线训练并达到离线训练的性能。
Figure 3: Draft-size ablation, Qwen3 target. Measured speedup, independent planning repeats, and the predictions used in Fig. 4 b. BFCL has one measured size study and no offline-hit prediction. Agreement and cost values are in Table 14 ; pooled results are in Table 1 .
arXiv深度剖析
论文提出一个针对动作推测回合的延迟框架,用收益与成本的对比来解释端到端加速的来源。 此前工作多直接套用推测解码思路、使用现成模型起草动作,而未系统回答“什么决定动作推测的端到端加速”这一问题。 摘要以框架形式给出该分析,并称在多种数据集、目标模型和草稿模型上,该框架能解释大部分实测加速。
LEAP 保持草稿模型很小,并通过在目标动作序列上训练来提升其与目标模型决策的一致率。 区别于“大草稿模型更常匹配但更慢、小现成模型快但很少与目标一致”的既有取舍,LEAP 试图同时获得小模型的低延迟与高一致率。 摘要报告使用 0.6B 小模型时,LEAP 在多数决策上与目标模型一致。
LEAP 使智能体端到端墙钟时间最高提速 60%,且任务成功率没有系统性变化。 把动作阶段的推测从概念验证推进到可测量的端到端延迟收益,并同时报告成功率这一对照维度。 摘要给出最高 60% 的端到端墙钟时间加速,并说明任务成功率无系统性变化;具体数据集、任务与统计细节未在摘要中给出。
草稿模型可以在线训练,无需事先收集轨迹,并达到与离线训练相当的性能。 降低了部署门槛:不必先有目标模型的历史轨迹才能训练草稿模型。 摘要称在线训练可匹配离线训练的性能,但未给出具体实验规模或对比数值。
启示与展望
该工作面向需要多步推理与工具调用的 LLM 智能体 rollout 场景,适用于希望在不改变目标模型决策的前提下降低端到端墙钟时间的部署方。其延迟框架可用于判断在给定草稿准确度与任务步数下,动作推测是否值得采用;在线训练路径则面向无法预先收集目标轨迹的实际部署环境。结果以摘要所述的数据集、目标模型与草稿模型组合为适用范围。
摘要未给出具体数据集名称、任务类型、目标模型规模、草稿与目标的逐项一致率数值,也未说明 60% 加速对应的任务与硬件条件,因此难以判断该加速在何种任务长度与工具调用成本下成立。在线训练与离线训练“性能相当”的判定标准与实验设置同样未在摘要中展开。此外,本次读取范围仅为摘要,正文中的图表、消融与统计细节未纳入,上述数值的稳健性有待原文核实。
