WAMJET 用编码智能体自动优化世界动作模型推理,在六种模型上实现最高 9.95 倍无损加速
相关研究与后续进展核心概要
WAMJET 是一个智能体式加速框架,为编码智能体提供可复用的优化指导以及测量与验证工具,采用瓶颈驱动的工作流对推理进行剖析、定向修改代码、验证效果并迭代优化加速栈,在六种世界动作模型、三种编码智能体和两种 GPU 架构上实现最高 9.95 倍的无损加速,近似与硬件感知优化还能进一步降低延迟且成功率相当。
Fig. 1 : Overview of WAMJET. (A) Manual optimization requires diverse domain expertise, with substantial engineering for each deployment. (B) A coding agent without guidance may only apply generic optimizations while leaving deeper optimization opportunities unexplored. (C) WAMJET equips the agent with reusable guidance and tools for faster startup, bottleneck analysis, hardware-aware optimization, and iterative validation, supporting acceleration strategies tailored to different WAMs and GPU architectures.
arXiv深度剖析
提出 WAMJET,一个智能体式加速框架,让编码智能体在可复用优化指导与测量验证工具支持下自动加速世界动作模型推理。 以往加速技术需要针对每个模型和硬件平台投入大量工程来选择和组合,WAMJET 把这一选择与组合过程交给智能体自动完成。 摘要说明该框架为编码智能体配备可复用优化指导以及测量与验证工具,并采用瓶颈驱动工作流。
WAMJET 采用瓶颈驱动工作流:智能体剖析推理、修改目标代码、验证效果,并随瓶颈转移迭代优化加速栈,同时保持动作质量。 该工作流把加速栈的构建描述为随瓶颈变化而迭代精炼的过程,而非一次性套用固定优化组合。 摘要明确描述该工作流包含剖析、定向修改、效果验证与迭代精炼,并强调保持动作质量。
实验覆盖六种世界动作模型、三种编码智能体和两种 GPU 架构,相对上游实现取得最高 9.95 倍无损加速。 该结果在多个模型、智能体与硬件架构上报告,说明加速栈可跨这些设置生成。 摘要给出六种 WAM、三种编码智能体、两种 GPU 架构的实验范围,以及最高 9.95 倍无损加速的数字。
近似与硬件感知优化带来额外延迟降低,且成功率相当。 在无损加速之外,近似与硬件感知优化进一步压缩延迟,同时保持可比的成功率。 摘要称近似和硬件感知优化产生额外延迟降低,成功率相当。
启示与展望
该工作面向世界动作模型推理加速,适用于使用预训练视频基础模型进行机器人操作、且推理成本成为部署瓶颈的场景。其瓶颈驱动工作流与可复用优化指导面向编码智能体,实验覆盖六种 WAM、三种编码智能体和两种 GPU 架构,因此结果适用于这些模型与硬件范围内的加速栈生成。近似与硬件感知优化可进一步降低延迟并保持相当成功率,适合在可接受近似、且硬件条件已知的部署中采用。
作为摘要,本文未给出各模型与硬件上的逐项加速比、动作质量与成功率的完整评测细节,也未说明近似与硬件感知优化各自贡献多少延迟降低。读者仍需关注:瓶颈驱动工作流在不同 WAM 与 GPU 架构上的稳定性、可复用优化指导的覆盖范围,以及近似优化在更广泛任务与硬件上的成功率表现。
