跳到主要内容
返回时间线
arXiv来源发表:

TIDE 把推理中产生的隐藏状态直接用于草稿模型在线适配,在真实负载上实现最高 1.66 倍吞吐并挽回静态草稿模型失配时的性能下降

核心概要

TIDE 是一个内嵌于服务引擎的框架,它把目标模型推理过程中产生的中间隐藏状态复用为草稿模型在线适配的训练信号,从而避免额外的目标模型计算与服务开销,并配合自适应运行时控制仅在有利时启用推测与草稿训练、把推理与训练映射到合适的 GPU 类别;在多样真实负载上,TIDE 相对无推测基线取得最高 1.66 倍吞吐,在静态草稿模型导致吞吐下降的失配负载上恢复性能,相比既有草稿训练方法把训练时间最多缩短 3.02 倍、存储需求最多降低 24 倍,并在异构 GPU 集群上把系统吞吐最多提升 1.22 倍。

Source-provided article image: TIDE: Temporal Incremental Draft Engine for Self-Improving LLM Inference
Fig. 1 ·

Fig. 1 : Normalized throughput of speculative decoding with a static draft model versus TIDE across four non-English Alpaca datasets. The static draft model, trained on English data, degrades throughput below the no-speculation baseline on all workloads. TIDE recovers and exceeds baseline throughput by continuously adapting the draft model to the current workload.

arXiv

深度剖析

TIDE 提出把目标模型在推理时已经产生的中间隐藏状态复用为草稿模型适配的训练信号,从而在不增加目标模型额外计算的前提下实现在线草稿适配。 既有草稿模型训练通常需要额外的目标模型计算或服务期开销,TIDE 把训练信号来源改为推理过程中本就存在的隐藏状态,把适配嵌入服务引擎本身。 原文以“reuses target model's intermediate hidden states generated during inference as training signals”描述该机制,并称其“avoiding additional target model computation and serving-time overhead”;证据来自框架设计与真实负载实验的整体结果,未给出该机制单独的消融数据。

TIDE 引入自适应运行时控制,只在推测与草稿模型训练有利时才启用它们。 静态草稿模型在负载演化时可能反而拖慢吞吐,TIDE 把“是否启用推测与训练”变成运行时决策,而不是固定配置。 原文表述为“employs adaptive runtime control to activate speculation and draft model training only when beneficial”,并以“recovering performance on misaligned workloads where static draft models degrade throughput”作为结果支撑。

TIDE 通过把推理与训练映射到合适的 GPU 类别来利用异构集群,在异构 GPU 集群上把系统吞吐最多提升 1.22 倍。 把草稿适配的训练负载与推理负载分别放到适配的 GPU 类别上,使异构硬件成为可用资源而非负担。 原文给出“improves system throughput by up to 1.22$\times$ on heterogeneous GPU clusters”,属于系统级实测结果。

在多样真实负载上,TIDE 相对无推测基线取得最高 1.66 倍吞吐,并相比既有草稿训练方法把训练时间最多缩短 3.02 倍、存储需求最多降低 24 倍。 这些数字同时覆盖推理吞吐、训练成本与存储占用三个维度,说明在线适配在收益之外也压低了适配本身的代价。 原文给出“up to 1.66$\times$ throughput over no-speculation baselines”“reduces training time by up to 3.02$\times$ and storage requirements by 24$\times$ compared to existing draft training approaches”,均为相对基线的倍数结果。

启示与展望

这项工作面向高性能 LLM 推理服务系统,尤其是负载会随时间变化、且集群中存在异构 GPU 类别的部署环境。它使服务引擎可以在运行中持续适配草稿模型,并在推测不再有利时关闭推测与训练;对系统工程师而言,可直接借鉴的是“复用推理期隐藏状态作为训练信号”与“自适应运行时控制”这两条设计思路。原文所述结果来自多样真实负载与异构 GPU 集群的实测,因此其适用范围应理解为这类服务场景,而非任意推理配置。

本次仅读到摘要级文本,未包含实验设置、负载构成、基线配置与消融结果,因此无法判断各项收益分别来自隐藏状态复用、自适应控制还是异构映射。原文中的倍数均为“up to”上限值,典型负载下的表现仍需在正文中确认。此外,草稿适配在负载快速切换时的收敛速度、以及隐藏状态复用对目标模型推理本身的干扰程度,都是值得继续关注的问题。

来源