vLLM-Omni 用统一编排器把语音、扩散、世界模型与机器人策略装进同一多阶段服务运行时
核心概要
vLLM-Omni 团队提出一个以编排器为中心的多阶段服务运行时,把 omni、TTS、扩散、世界模型与 VLA 工作负载拆成绑定独立引擎与资源预算的 stage,通过 OmniConnector 传输隐藏状态、codec 码、latent 与分页 KV,并用 session 控制长时交互;在 H100/H200 上报告了 Qwen3-Omni 语音服务、TTS 组合、图像视频扩散与 MiniCPM-o 双工健康度指标。
Figure 9 : Qwen3-Omni Fixed-Len-2500/900 on 2 × 2{\times} H100: async-chunk versus no-async-chunk for mean TTFT, E2EL, and audio RTF.
arXiv深度剖析
系统把服务拆成 stage 与 orchestrator 两层:stage 绑定一个模型组件、一个执行引擎和显式资源预算,orchestrator 独占请求准入、跨 stage 推进、客户端可见进度与完成判定,并明确不调度 stage 内 token、不管理分页 KV、不做扩散去噪。 此前 vLLM、SGLang 面向单一自回归解码循环,扩散栈面向 DiT 去噪,二者都不提供跨 AR、语音 codec、扩散与动作生成器的共享控制面;该报告把编排、流式进度、副本池、中间数据搬运与 session 显式提升为运行时关注点。 架构描述配合模块图与逐节展开,属于系统设计论证而非对照实验;文中以 Qwen3-Omni 的 thinker→talker→code2wav 与扩散 DiT/VAE 边作为具体载荷示例。
中间数据被当作有类型的载荷管理:隐藏状态与 embedding、codec 码、分页 KV 块、latent 与多模态张量分别由 stage runner 与 bridge processor 组装,OmniConnector 只提供 put/get/cleanup/health 的语义无关传输,控制面只走轻量元数据。 把 KV 从通用张量通道中独立出来,由专用 KV 管理器负责抽取、键控与注入,使 prefill–decode 与 AR-to-DiT 边可以复用同一传输而不必为每种产物新建网络栈。 以 Qwen3-Omni 的 thinker→talker 边携带选定层隐藏状态、prompt embedding 与 TTS 特殊 embedding,talker→code2wav 边发布 codes.audio 及左上下文与 finished 标志为例;KV 路径引用 Mooncake 类后端。
async_chunk 让下游 stage 预暖并在数据面接收分块,使波形解码与 codec 预测重叠,从而压低首个音频包时延;该模式按边配置,批量全载荷路径仍保留。 把流式输入输出建模为同一请求身份下的请求进度,而不是旁路通道;扩散工作负载还可在生成中接受 prompt 更新,长时交互则在同一控制面上叠加 session 身份、保留与准入。 在 Fixed-Len 上关闭 async-chunk 时,高并发单元出现数秒级 TTFT 且平均 RTF 接近 1,而开启时同并发下 TTFT 与 E2EL 明显更低,说明重叠机制在高负载下作用更大。
评估覆盖 Qwen3-Omni 语音服务、TTS 组合、图像与视频扩散、Cosmos3/MiniMax 视频单元以及 MiniCPM-o 双工健康度,并对比各模型默认部署与可选优化配置。 报告给出 MRv2、融合单卡 Qwen3-TTS、Cache-DiT、Ulysses2+CFG2、USP2+HSDP 等配置在同一运行时下的系统级读数,而非单一模型的孤立基准。 语音表在 H200 上测量,图像、视频与世界模型表来自 H100 多模态 nightly CI 冻结日 2026-09-14;报告声明所有列出的单元均成功完成。
启示与展望
该运行时面向需要在线多模态生成服务的工程团队:omni 对话与语音、TTS、图像与视频扩散、世界模型 rollout 以及 OpenPI 机器人策略。适用设定是同一进程内加载一条多阶段流水线,stage 可同机或跨进程、跨设备、跨主机放置,边可逐条选择分块或全载荷传输。对长时交互,session 层在同一控制面上提供身份、保留与准入,双工语音、世界模型与机器人循环因此不必另起运行时。扩散分页 KV 已在选定 DiT 流水线上以调度器管理的块分配方式提供,但覆盖与缓存感知准入在不同模型族之间仍不均衡。
报告把跨框架对照与工程健康度聚合排除在本版之外,因此难以判断这些读数相对其他服务栈的位置。文本中多处数值与并发档位在表格与正文里以占位形式出现,具体数字需回到原表核对。MRv2 在 Qwen3-Omni 上需要一行属性守卫才能启动,在文本-only 路由上还出现过 thinker 退出与请求失败,报告因此只列默认部署。MiniCPM-o 的 turn-mode MRv2 配置虽更快,但在 13% 输出中在目标句后追加无关语音,故未作为结果报告。扩散分页 KV 的覆盖、缓存感知准入、更广的 session 工作负载、闭环机器人评估与跨硬件平台测量均被列为未来工作。
