Liquid AI 为 LFM2.5-VL-3B 配上 280M 参数的 DSpark 草稿模型,在 M5 Max 上解码最高加速 3.13 倍、H100 上最高 2.66 倍
核心概要
Liquid AI 发布 LFM2.5-VL-DSpark 视觉草稿模型,沿用其文本 DSpark 架构,把图像块与文本 token 投影到同一表示后由 4 层注意力草稿器预测候选 token 块,仅增加约 280M 参数(相对 3B 目标模型增加 8.9%),在 M5 Max 上按任务实现 2.30x 至 3.13x 解码加速与 1.56x 至 2.62x 端到端提升,在 M3 Ultra 上为 1.57x 至 2.14x 与 1.30x 至 1.77x,在 H100 上端到端提升 1.64x 至 2.27x,并随模型提供 llama.cpp、MLX-VLM 与 SGLang 的首日集成。
深度剖析
把文本推测解码草稿器扩展到视觉语言模型:草稿器在固定被抽取层读取目标模型隐藏状态,图像块与文本 token 先投影到共享表示,因此无论输入模态如何,草稿器处理的隐藏状态向量维度一致,推理算法与文本模型相同。 相对此前仅面向文本的 LFM2.5-DSpark 草稿器,这里给出了同一套 DSpark 配方在视觉语言输入上的可用实现,说明模态差异可以在投影层被吸收而不必改动推测解码算法。 文中给出架构描述与推理流程说明,并说明草稿器基于视觉语言 SFT 数据混合训练;未提供与文本草稿器的对照实验数据。
草稿器规模与结构经过消融确定:在 3、4、5 层之间做消融后选定 4 层纯注意力草稿器与块大小 9,最终数据混合训练 10 个 epoch,接受率随训练 token 增加而提升直至收益递减;推理时建议按硬件使用块大小 8 或 9。 给出了具体的设计取舍与训练轮数,而不仅是最终指标,使复现者知道层数、块大小与训练量的选择依据。 依据是 3/4/5 层消融与逐 epoch 接受率测量;文中未给出消融的绝对数值表。
参数开销很小:草稿器约 280M 参数,其中解码器栈 193.0M、隐藏状态投影 21.0M、Markov 头 65.5M、归一化与置信头 6.4k,合计 279.5M,相对 3B 目标模型仅增加 8.9%。 把加速能力与明确的参数预算对应起来,说明视觉推测解码不必以大幅增加部署体积为代价。 文中给出逐组件参数表,属于可核对的模型规模数据。
在六类视觉任务(通用 VQA、文本 VQA、图像描述、图表 VQA、复杂推理、多轮对话,参照 MMSpec 基准)上测量端侧与 GPU 推理:MLX 在 M5 Max 上解码 2.30x 至 3.13x、端到端 1.56x 至 2.62x;llama.cpp 在 M3 Ultra 上解码 1.57x 至 2.14x、端到端 1.30x 至 1.77x;H100 上端到端 1.64x 至 2.27x。 把加速效果按硬件与任务分别列出,并同时报告解码与端到端两个口径,便于读者判断在自己设备上能拿到多少收益。 基于两种端侧配置与一种 GPU 配置、六类任务的实测;文中未给出各任务的逐项数值与基线绝对延迟。
启示与展望
该结果面向使用 LFM2.5-VL-3B 并希望降低解码延迟的部署场景,适用于端侧 Apple 芯片与 H100 单卡环境,并已在 llama.cpp、MLX-VLM、SGLang 三条推理路径上给出可执行配置。文中说明推测解码是精确的:目标模型会验证每个候选 token,因此贪心输出与单独运行目标模型一致,这使该方案可用于对输出一致性有要求的场景。对希望降低视觉编码或预填充耗时的工作,这一方法并不覆盖,因为文中明确指出推测解码只加速解码。
文中未给出各任务逐项加速数值、基线绝对延迟与接受率曲线,因此难以判断不同任务间差异的来源;H100 解码加速区间写作 20.4x 至 2.66x,区间下界与上界方向不一致,读者需以原文或后续材料核对;此外,草稿器在视觉语言数据上的训练细节、数据构成与消融的绝对结果未展开,这些是后续可关注的方向。
