跳到主要内容
返回时间线
arXiv来源发表:

STAVE 用两个任务向量替换上下文示例,在六个多模态模型上以零样本推理成本超过逐层干预方法

核心概要

该工作提出 STAVE,用两个任务特定向量(一个更新答案生成 token 的读出向量、一个更新其余结构 token 组的上下文向量)加到冻结大模型或大视觉语言模型的输入嵌入上以替代上下文示例,二者用答案标签在有示例和无示例提示上训练;在六个 LMM 与五个 LLM 上,STAVE 以远少任务参数匹配或超过逐层干预方法,在 18 个文本任务上超过 15-shot ICL 与既有任务向量,且推理成本与零样本相同。

Source-provided article image: Two Vectors Replace In-Context Demos: Structured Task Adaptation via Embeddings
Figure 1 ·

Figure 1: STAVE performance and efficiency. Bars are relative to STAVE, and params use a log scale (Appendix E.3 ).

arXiv

深度剖析

STAVE 把任务状态放在输入嵌入层,只学两个向量:读出向量覆盖最后提示 token 与答案提示词,上下文向量覆盖其余五个结构 token 组,任务参数不随模型深度增长。 既有免示例方法要么把状态放在按任务搜索的层或注意力头上,要么放在每个解码器层,参数随深度增长;STAVE 无需层、头或 token 搜索,且不改变提示长度。 论文用一阶损失分析与 margin 界论证设计选择,并在六个 LMM 与五个 LLM 上做实验;表 1 中 STAVE 存储参数为 0.008M,而 LIVE、MimIC、HiFICL 分别为 0.13M、0.26M、2.2M。

在 Idefics2-8B 与 Qwen-VL-7B 上,STAVE 在表 1 每一列取得最好成绩,平均分别为 82.75% 与 83.61%,高于 MimIC 的 81.22% 与 82.07% 以及 HiFICL 的 80.84% 与 82.54%。 这些对比方法在解码器层内部学习参数,而 STAVE 只在输入嵌入处加两个向量,却取得更高平均分,说明把值拟合到答案比选择注入位置更重要。 表 1 报告三次运行的均值与标准差,STAVE 平均标准差为 0.19 与 0.14,低于多数对比方法;表 2 与附录 G.1 在更多 LMM 上重复该比较。

在五个 LLM 的 18 个 TV 基准任务上,STAVE 平均 91.5%,高于 15-shot ICL 的 90.8% 与 SITE 的 91.0%,且推理时不使用任何示例。 TV 与 FV 等提取式任务向量平均仅 75.8% 与 48.2%,LoRA、prefix tuning 与 PT 训练更多参数却低于 5-shot ICL。 表 3 覆盖 Pythia 2.8B/6.9B/12B、LLaMA 7B 与 GPT-J 6B,每个任务按测试查询数加权,配置在无示例开发集上选择。

消融显示增益来自读出/上下文分离:单向量、按模态切分(Text/image)或把答案提示词并入上下文(Last/rest)都更差,三个或七个向量也不带来增益。 这排除了“更多向量”或“模态切分”作为解释,并对应 Proposition C.2(iii) 的预测:两个 token 集梯度余弦越低,分离收益越大。 表 14 在 Idefics2 与 LLaVA 的 COCO 与 VQAv2 上比较八种分组配置;图 8 在 18 个任务与五个 LLM 上测量训练前余弦,最低三分位余弦处 STAVE 优势为 43.7 分,最高三分位为 27.5 分。

启示与展望

该方法面向希望以零样本推理成本适配冻结 LLM 或 LMM 的研究者与工程团队:每个任务只需一次训练,得到两个向量,推理时在无示例提示的预填充阶段加一次,提示长度、KV 缓存形状与解码器计算量等同零样本推理。适用场景是单张查询图像加短答案或短标题的提示,以及 TV 基准那类模板化文本任务;训练需要访问模型权重,并需通过冻结解码器反向传播。论文指出,把结构 token 组扩展到多图与视频提示、以及长程推理任务是自然的下一步。

读者仍需关注几点:训练虽是一次性成本,但要反传穿过冻结解码器,显存与时间随骨干规模增长,且需要权重访问权限;方法依赖带标签的训练样本,样本减到十分之一时分数下降数点。论文的 LMM 实验限于单张查询图像与短答案或标题,多图、视频与时间理解任务尚未验证。此外,读出与上下文向量的分工来自对 Idefics2 与 LLaVA 检查点的分析,其他骨干上的机制细节仍是开放问题。

来源