TomasuLLM 让 LLM 智能体乱序投机执行工具调用,在 SWE-bench Verified 上取得 1.31 倍加速且 4,010 条提交校验记录零误接受
相关研究与后续进展核心概要
TomasuLLM 是一个在保持任务执行正确性的前提下乱序执行智能体工具调用的运行时,它先草拟未来动作、在隔离的写时复制沙箱中运行、追踪依赖与副作用,并在对已提交状态校验通过后按轨迹顺序提交结果;在三个覆盖亚秒级到分钟级工具调用的基准上,它报告了 100 个 SWE-bench Verified 任务 1.31 倍、28 个 Terminal-Bench 2.0 任务 1.35 倍、18 个 SWE-Marathon 会话 1.27 倍匹配进度的提升,并在 4,010 条审计过的提交校验记录中产生零误接受。
Figure 1. Observation-stall slack and the commit boundary. (a) The base agent serializes at observation boundaries. (b) TomasuLLM executes drafted actions in COW overlays and publishes only validated observations in main-agent order. (c) The CPU analogy separates prediction from in-order commit. Three side-by-side panels. Panel a shows the base-agent serial path: LLM reasoning, tool execution T1, LLM reasoning, tool execution T2, and the final answer, where each tool observation must return before the next action issues. Panel b shows the TomasuLLM runtime with a drafting region and an overlay-execution region. The Action Drafter emits predicted tool actions, the Observation Drafter emits a predicted observation, and real tool executions T1 and T2 run in copy-on-write overlays, with T2 finishing first; sandbox observations flow into the Validate and in-order commit stage before publication, and a mismatch discards the speculative suffix. Panel c shows the CPU analogy: branch and value prediction feed fetch, decode, rename, and issue; instructions I1 and I2 execute out of order; validation and the reorder buffer commit in order, with mispredictions squashed.
arXiv深度剖析
该工作提出 TomasuLLM,一个乱序执行智能体工具调用的运行时,同时保持任务执行正确性。 相对按轨迹顺序执行的常规智能体循环,它把可预测的未来工作提前启动,以缓解长耗时工具(编译器、测试套件、仓库命令)造成的观察停顿。 摘要以机制描述加三个基准的量化结果支撑,并给出 4,010 条审计提交校验记录中零误接受的正确性统计。
其执行流程为:草拟未来动作、在隔离的写时复制沙箱中运行、追踪依赖与副作用,并在对已提交状态校验后按轨迹顺序提交结果。 投机结果只有在自身及所有更早步骤都通过校验后才可见,这一提交规则把乱序执行与顺序可见性接口结合起来。 摘要明确陈述了沙箱隔离、依赖与副作用追踪、按轨迹顺序提交以及针对已提交状态的校验。
加速随工具延迟增长:100 个 SWE-bench Verified 任务 1.31 倍、28 个 Terminal-Bench 2.0 任务 1.35 倍、18 个 SWE-Marathon 会话 1.27 倍匹配进度。 三个基准覆盖亚秒级到分钟级工具调用,说明收益与工具延迟这一瓶颈直接相关。 摘要报告的是各基准的均值提升,并说明其随工具延迟扩展。
在 4,010 条审计过的提交校验记录中,系统产生零误接受。 该统计针对投机执行最核心的风险,即未经校验的结果被提前暴露。 摘要给出记录条数与零误接受这一计数型结果。
启示与展望
该工作面向工具调用耗时从亚秒级到分钟级的编码智能体场景,尤其是编译器、测试套件与仓库命令占主导的负载;其收益被描述为随工具延迟扩展,因此最适用于长耗时工具占比高的轨迹。对希望减少智能体空转等待的运行时与智能体框架开发者,它提供了一种在保持按轨迹顺序可见性的前提下提前启动可预测工作的路径。
摘要只报告各基准的均值提升,未给出逐任务分布、方差或与基线的逐项对比,因此收益在不同任务上的稳定性仍是开放问题。零误接受基于 4,010 条审计记录,这一规模下的结论在更大或更异构的轨迹集合上如何保持,摘要未作说明。此外,投机草拟的命中率、沙箱开销以及校验失败时的回退成本未在摘要中量化,这些都会影响实际部署中的净收益。
