QASLR 让长视频检索 Hit@1 从 54.2 提升到 70.7,并在 2B 与 8B 骨干上同时生效
相关研究与后续进展核心概要
作者提出查询感知流式潜在推理(QASLR)后训练框架:先选出有界帧集合并恢复时序,再按片段逐段送入视觉语言骨干,用一组持久 think token 跨片段累积证据、由 embed token 每步读出固定维度表示,训练结合最终对比损失、逐步对比监督与最终嵌入自蒸馏;在 2B 与 8B Qwen3-VL-Embedding 上,HourVideo 检索 Hit@1 分别从 54.2 升至 70.7、从 57.4 升至 72.8,并在所评估的时刻检索与视频问答任务上取得提升,流式头还可迁移到同族的 RzenEmbed 7B。
Figure 1: From one-shot video encoding to streaming evidence accumulation. The upper-left pathway illustrates a one-shot baseline that pools representations from sparsely sampled frames into a single video embedding. The lower-left pathway shows QASLR processing selected frames as ordered clips and producing embeddings throughout the sequence. The right-hand panels summarize example training signals and the intended capabilities of persistent memory, intermediate supervision, optional early exit, and parameter-efficient post-training.
arXiv深度剖析
QASLR 把长视频的时间覆盖与表示尺寸解耦:持久潜在记忆按时间顺序逐片段累积证据,输出固定维度嵌入,无需把所有选中帧放进同一次骨干上下文。 已有做法或扩大上下文、或压缩视觉 token、或聚合片段描述、或做查询相关帧选择;QASLR 在这些输入选择与压缩之外,把选中片段证据累积进固定维度嵌入。 方法层面给出流式编码、记忆更新与读出公式;消融显示相对完整 QASLR,打乱片段顺序使 HourVideo Hit@1 下降 6.6 点、反转下降 5.7 点、重置记忆下降 10.4 点、仅用最后片段下降 13.8 点,并比所报告的 Transformer 聚合器高 4.5 点。
训练目标同时监督中间与最终表示:最终对比学习、逐步对比监督与以最终嵌入为停止梯度教师的自蒸馏共同作用,使部分视频读出也可用于检索。 相对仅用最终监督,逐步监督与自蒸馏把四个检查点(25%、50%、75%、全部片段)的平均 Hit@1 从 57.3 提升到 65.1,最终 Hit@1 从 67.9 提升到 70.7。 四组损失组合消融在相同设置下比较;25% 检查点从 43.8 提升到 55.6,最终从 67.9 提升到 70.7,作者说明早期检查点收益更大。
完整 QASLR 配方在 2B 与 8B 两个规模上提升全部所报告任务,并在同族骨干上迁移。 相对原始检查点,HourVideo 检索 Hit@1 分别提升 16.5 与 15.4 点;相对单轮后训练提升 15.7 与 15.0 点;RzenEmbed 7B 上七个展示任务均超过两个基线,相对原始检查点提升 3.4–6.0 点。 九个长视频任务、2B 与 8B 两个规模、三个随机种子平均;检索式任务平均 Hit@1 从 45.8 升至 53.5(2B)、从 47.2 升至 54.8(8B),QA 平均准确率从 48.3 升至 50.6、从 61.2 升至 66.3。
交错子批处理是增益的重要来源,且对单轮与流式两种后训练都有效。 加入子批处理后,QASLR 平均检索 Hit@1 从 54.5 升至 61.1(2B)、从 55.7 升至 63.0(8B);单轮后训练也从 52.2 升至 56.8、从 53.8 升至 59.9。 该配置同时改变有效批大小与负样本池;在子批处理下 QASLR 在两个规模、三个检索任务上 Hit@1 均高于单轮基线,但 QA 优势随任务而异。
启示与展望
该工作面向需要把长视频压入固定维度嵌入的检索与排序场景:查询无关选择与编码可产出每视频一个可复用表示用于语料索引,查询感知路径产出查询条件表示,作者说明其适用于有界候选集或二阶段重排。方法在 2B 与 8B Qwen3-VL-Embedding 上验证,并迁移到同族 RzenEmbed 7B;训练只更新流式头(约 2 亿与 6 亿可训练参数),骨干冻结,后训练主要使用 LLaVA-Video-178K 并补充 1 万条 ActivityNet 视频,训练与评测源视频零重叠。评估使用有界候选集(视频检索通常 4 或 8 个候选,时刻检索 8 或 16 个片段,分类 4–8 类,问答四个选项),结果按三个随机种子平均。可选早退机制面向局部片段问答,固定长度检索使用完整序列。
读者仍需关注若干开放问题:潜在记忆无法恢复未被选中的证据,因此效果依赖帧选择器;相对子批处理单轮基线,检索优势一致但问答优势随任务与规模变化,2B 上单轮在四个问答任务中的三个更高;顺序与记忆扰动只在推理时施加,作者说明这测量的是对输入与状态更新分布变化的敏感性,而非内部推理过程;迁移仅在 Qwen 族内评估;热缓存延迟依赖选择、解码、候选数量与硬件,固定记忆尺寸并不等于总计算成比例下降;种子平均分数描述经验差异,未建立统计显著性;早退界是在所述校准假设下与全步预测的一致性,而非无条件真值准确率。此外,正文中若干公式、损失权重与部分数值以占位形式呈现,摘要与表格中的数值可核对,但公式细节需查阅原文与附录。
