Yandex团队用AsyncLLM让Qwen 3.x模型无需微调即可边看边想边行动,在流式视频、游戏与系统监控中同时提升响应速度
核心概要
该工作提出AsyncLLM——一个基于Python asyncio的async/await编程模型、让预训练LLM以并发协程方式观察、推理与行动的通用异步智能体框架,通过CacheBlock(注意力KV缓存与Gated DeltaNet循环状态)与cache view实现协程间实时共享记忆,并在流式视频理解、ViZDoom游戏和DevOps-Gym系统监控三类任务上,用同一族Qwen 3.x视觉语言模型在无任务特定训练的情况下完成异步运行。
深度剖析
提出AsyncLLM:把并发放在推理内部而非API调用周围,智能体由一组Python async/await协程构成,每个协程写入自己的CacheBlock,并通过cache view选择关注哪些块,从而在推理尚未完成时读取彼此不断演化的状态。 此前实时语音、流式视频、VLA机器人控制、异步工具调用等各自以任务特定架构或训练解决并发;该工作把这些并发模式统一到一个通用编程模型下,并明确归纳出探针与监控、并行推理流、子程序与委派、中断与增量输入、共享演化上下文五类并发模式。 论文给出框架定义、CacheBlock与cache view的形式化描述,并附开源参考实现(基于Mini-SGLang),在三个不同任务域上以同一族Qwen 3.x模型验证,属于框架级设计与多域实证。
给出支持混合与多模态LLM的并行GPU推理算法:全注意力层沿用并扩展查询旋转(RoPE)思路,线性注意力/Gated DeltaNet层把逐token更新改写为块级仿射变换并按块顺序组合,MRoPE则按块维护位置跨度而非按token数旋转。 此前基于并发注意力的记忆共享主要面向全注意力RoPE模型;该工作把块级组合推广到Gated DeltaNet、KDA等线性注意力变体以及多模态旋转位置编码,使现代混合MLLM也能使用任意cache view。 论文给出公式推导(式1至式10)说明块级组合与顺序无关性,并在附录D讨论滑动窗口、GQA/MQA、MLA、稀疏注意力、ALiBi、NoPE等架构变体的兼容性;附录E报告了合成负载下的吞吐与延迟测量。
在流式视频理解上,AsyncLLM智能体由事件探针、后台思考线程、输出探针、描述写入器和非LLM输出编译协程五个并发组件构成,使用免训练探针(直接以预填提示运行基础LLM单次前向),在SoccerNet-Caption与ProactiveVideoQA上,Qwen3.5+系列模型的表现超过专门训练的Mage-VL。 此前流式视频方案通常需要训练轻量探针或专门模型;该工作表明通用MLLM在AsyncLLM框架下无需任务特定训练即可承担事件检测与描述生成,且探针可复用基础模型本身。 论文报告了事件探针ROC AUC、TriggerAcc、TimVal以及ProactiveVideoQA的PAUC等指标,并给出Mage-VL的超参数调优扫描;作者同时说明SoccerNet官方协议不衡量描述质量,描述质量优势体现在ProactiveVideoQA上。
在ViZDoom游戏与DevOps-Gym系统监控上,异步智能体在保持推理收益的同时显著加快响应:监控任务中AsyncLLM以约3837次前向通过达到55.88%准确率,而顺序基线以8452次前向通过达到61.76%;游戏任务中AsyncLLM智能体比同模型顺序智能体反应快得多。 此前系统监控与游戏智能体多以顺序方式处理日志或帧;该工作把流式视频智能体架构迁移到日志流与交互式游戏,并额外测量响应及时性而非仅准确率。 论文报告了34个DevOps-Gym监控任务上的准确率与前向通过次数,以及ViZDoom两个场景(HealthGathering、DeadlyCorridor,frame skip 4)与顺序、仅探针两种基线的对比;作者明确说明游戏结果只展示基本能力而非该环境的最优性能。
启示与展望
该框架面向需要在推理进行中接收新输入的部署场景:实时语音与视频助手、具身与交互式智能体、系统与日志监控。它适用于希望用现有开源模型快速搭建异步智能体、而不愿为每种并发场景收集数据并微调的开发者;论文也指出可通过修改后的实时API传入智能体定义,或让模型自行编写智能体定义。实验覆盖Qwen 3.x系列模型与三类任务,作者将结果定位为通用异步能力的可行性展示,而非各任务上的最优性能。
论文自述让智能体自行定义协程的能力“尚不可靠”,在HealthGathering上表现良好但在DeadlyCorridor上较差,这一方向仍需后续研究。异步执行可能让智能体在较慢的推理或监控协程介入前就发出错误或有害动作,作者建议在敏感场景中加入沙箱、输出校验与监控。参考实现被作者描述为最小实现,未包含全部可能的代码优化,也未在实验中启用投机解码或压缩,因此效率数字反映的是该实现而非上限。此外,本证据包为全文解析,部分表格与图的具体数值以文本形式给出,若需精确复现实验设置仍需查阅原文附录。
