研究者用条件流匹配反演器从多向量视觉文档索引重建页面,原始索引恢复47%词与45%敏感词元并98.4%首位命中源页
核心概要
该工作把多向量视觉文档索引的反演建模为条件文档图像生成,在零侧信息下仅凭存储的向量识别编码器、推断页面形状并恢复乱序索引的顺序,用条件流匹配反演器重绘页面;在ViDoRe v3上,原始索引反演出的页面恢复47%的词和45%的敏感词元,并以98.4%的比例把源页排在第一。
深度剖析
仅凭存储的多向量索引即可重建文档页面:原始索引反演出的页面恢复47.4%的参考词、45.0%的敏感词元,字符级NED为0.292,并在19,252个索引页中98.4%把源页排第一。 此前嵌入反演研究集中在文本嵌入和自然图像特征,未考察视觉晚交互检索器的多向量页面索引;该工作把反演表述为条件文档图像生成,在零侧信息下完成。 在ViDoRe v3的2,000页固定评测集上评测,训练语料为682,818页公开页面且与目标语料来源不同;对照包括空模型(词召回0.001)、kNN基线(0.234)和VAE重建上界(0.956),独立评判编码器给出的top-1为97.7%。
攻击所需的三项缺失信息都能从索引本身推断:编码器在13个公开检索器中26,000次单页判定全部识别正确,原始索引形状恢复99.2%,乱序索引形状恢复99.95%。 存储索引不包含编码器身份、页面形状和乱序排列,该工作用结构过滤加参考云、周期性与集合分类器、以及位置模型的纵横比头分别补齐,使攻击无需任何侧信息。 编码器识别在13个公开编码器构建的存储上评测,参考云在26,000次单页判定中零错误;形状推断在固定评测集上报告准确率,并给出真实形状对照说明影响很小。
两种廉价防护表现不同:池化把词召回压到约8%且当前攻击无法反演,而乱序可被位置模型部分破解,源页首位命中从3.8%升到93.5%。 此前没有针对视觉晚交互索引的防护评测;该工作显示乱序不改变检索结果却可被顺序恢复削弱,而池化索引的反演仍是开放问题。 池化3和9的词召回为7.6%和8.1%,低于kNN基线;位置模型把乱序向量定位到平均1.8行、4.5列的误差,重排后词召回23.1%、敏感词元召回21.2%,独立评判下top-1为87.7%。
攻击可迁移到第二个检索器但内容泄漏不随之迁移:对ColQwen3.5-4.5B原始索引反演页面70.2%把源页排第一,词召回7.9%仍低于kNN基线的22.3%。 该工作把同一套训练与推理流程原样应用到不同团队、不同骨干的第二个公开检索器,检验结论是否只适用于单一模型族。 第二个编码器的模型在346,770页上训练且不含VDR-MEGA-2;同一数据训练的控制反演器对第一个编码器达到55.5%词召回和98.9%首位命中,说明差距来自编码器而非数据。
启示与展望
该结果适用于把索引与页面分开存放的场景,例如托管向量数据库、索引与文档分属不同访问层级、以及索引快照与备份;在这些场景中,存储的索引可能是入侵者唯一获得的页面副本。作者建议原始索引应按其编码的文档同等保护,并指出乱序不是可靠防护。对防御方而言,池化在当前攻击下把词召回压到约8%,是文中唯一未被反演的存储配置;对后续研究而言,论文给出了固定评测集、两种编码器的索引与协议,并以kNN与空模型为下界、以有序索引为目标。
池化索引的反演仍是开放问题,作者明确说明其失败是所试方法的失败,而非池化安全的证据,并列出软位置、可微分配与更大容量三条可能路径。内容指标以源页OCR转录为参考,敏感词元由正则启发式定义,未做人工研究确认其与读者判断一致;反演页面中哪些部分正确无法逐项核实,作者建议对同一索引多次采样并只保留一致内容以区分高置信泄漏与生成内容。第二个编码器泄漏更少的原因无法归因于输入分辨率、向量数量或训练数据中的哪一项。此外,本次解析未包含图表,图3、图4、图19等图注内容只能依据正文描述理解。
