ColNanoVDR 用无文档查询蒸馏把多向量视觉文档检索的查询编码器压到 149M,保留约 95% NDCG@5 且 CPU 单线程快 26 倍
核心概要
该工作提出 ColNanoVDR,用基于熵最优传输并带可学习 token 权重的 OTW 目标,把多向量视觉文档检索的教师查询编码器蒸馏为仅文本的 149M 学生模型,训练时不编码也不读取任何页面,在 ViDoRe v1–v3 上保留教师约 95% 的 NDCG@5,单 CPU 线程查询编码最高快 26 倍,并在相同训练下以 12.6 分之一的缓存教师数据量达到与分数蒸馏相当的效果。
深度剖析
首次把无文档查询侧蒸馏扩展到多向量视觉文档检索,学生只对齐教师的查询 token 集合,训练中不编码、不读取任何页面。 此前 NanoVDR 只在单向量检索器上做到无文档蒸馏,而多向量检索器的标准做法是分数蒸馏,需要缓存每个训练页面(论文估计 ColVec1.1 一百万训练对约需 2 TiB 页面 token 缓存)。 论文给出方法推导与实验:五个教师、ViDoRe v1–v3 评测,并报告 OTW 读取的缓存教师数据为分数蒸馏的 12.6 分之一(342.7 对 27.3 GiB)。
提出 OTW 目标:用熵最优传输对齐学生与教师的查询 token 集合,并由一个线性权重头从查询本身预测每个学生 token 的权重,无需两种分词之间的对应关系。 已有最优传输蒸馏多用于标签分布、输出分布或批内特征,而这里传输的是检索分数本身所依据的两组 token 嵌入;权重也不同于依赖语料统计或相关性标签的既有做法,而是作为传输计划的学生侧边缘从查询上下文学习。 论文给出定理与证明(Theorem 1 及附录 A),并在相同训练条件下与 InfoNCE、Listwise KL、Coverage、OT-uniform 对比;在 ColQwen3.5 上 OTW 与最强文档依赖基线 Listwise KL 在 v1、v3 持平、v2 略低(60.0 对 61.2),在 Tomoro-ColQwen3-8B 上三项均领先,v3 领先 5.0 分。
证明对齐代价在任意页面上界住学生与教师的 MaxSim 分数差,因此只对齐查询在原理上就足以控制检索分数。 MaxSim 对页面 token 取最大值,此前并不显然能由查询侧对齐控制;该定理把 OTW 最小化的量变成对未见页面分数差的充分条件。 附录 A 给出完整证明,附录 E 在 4,735 条评测查询上实测该界成立且非平凡,但偏松,约为所认证最坏分数差的八倍,论文明确称其为充分而非必要条件。
在五个教师上验证保真度与效率:149M 纯文本学生在 v1 保留约 99% 的教师 NDCG@5,在 v2 与域外 v3 企业集合上保留 93.0%–96.5%,单 CPU 线程编码 87 ms,比 ColQwen3.5 教师快 26 倍。 学生只替换查询编码器,教师文档编码器与页面索引保持不变,因此无需重建索引,且与索引侧压缩互补。 Table 1、Table 2 与 Figure 1 给出各教师逐项数字;容量消融显示保留率从 Ettin-32M 到 Ettin-400M 单调上升;索引压缩实验中池化因子 9 时保留率仅从 95.8% 降到 95.3%。
启示与展望
该结果面向已部署多向量视觉文档检索、希望降低查询编码延迟而不重建索引的场景:教师文档编码器与页面索引原样保留,学生以加权 MaxSim 接入现有 late-interaction 引擎,因此可与索引侧 token 池化叠加使用。它适用于以 ViDoRe 类页面图像检索为目标的英文查询负载,也适用于需要频繁更换教师、希望避免重复缓存页面的训练流程。论文的容量消融给出了从 32M 到 400M 的保留率曲线,便于按延迟预算选择学生规模。
论文自述所有学生来自单一 Ettin 编码器家族,且每个配置只跑一次、固定种子、未报告方差;在 ColQwen3.5 上无文档目标之间差距最多两分,v1 上的差距落在单次运行无法分辨的范围内。目标对比只覆盖两个教师,其余三个教师只训练了 OTW,因此分数蒸馏与固定权重替代方案在它们上的排序未被检验。训练查询虽不读页面,但都来自配对集合,未在无配对查询日志上训练。方法只压缩查询编码器,索引大小与存储仍属教师,搜索成本只通过更短的查询下降。理论保证是充分条件,实测偏松约八倍,且不区分学生测度的不同加权方式。评测以英文为主,未按语言拆分结果。
