跳到主要内容
返回时间线
arXiv来源发表:

RenderRank 把文档渲染成图像再压缩为视觉 token 做重排序,BEIR 平均 NDCG@10 达 55.96 且输入 token 减少 16.5–35.5%

核心概要

RenderRank 将文档文本渲染为图像并编码为压缩视觉 token,用文本教师做跨模态相关性蒸馏、再用查询内对比学习区分正负文档,在 BEIR 11 个数据集上以平均 290.07 个输入 token 取得平均 NDCG@10 55.96,比所评估的文本重排序器少用 16.5–35.5% 输入 token,并在四个长文档数据集上以约一半的平均输入 token 取得平均 NDCG@10 88.27。

AI-generated editorial illustration: RenderRank: Learning to Rerank Text with Compressed Visual Tokens

深度剖析

提出以压缩视觉 token 替代文本 token 做查询相关打分的重排序器 RenderRank,文档图像可预先独立于查询编码,打分时只把文本查询与视觉表示一起送入语言主干。 此前视觉文本压缩主要用于问答与摘要等生成任务,图像—文本重排序多聚焦预计算视觉特征或列表式单次前向;RenderRank 把这一表示方式接到逐候选打分的重排序上,并保持查询为文本。 论文给出渲染流程(Roboto Regular 12pt、行距 1.0、96 DPI、宽 896 像素、高按 32 像素递增、超页续图)与两阶段训练目标(分数级 MSE 蒸馏、查询内 InfoNCE),并在 11 个 BEIR 数据集与 4 个长文档数据集上评测。

两阶段训练各自带来可测增益:跨模态相关性蒸馏把图像输入的平均 NDCG@10 从 50.20 提升到 54.86,查询内相关性判别再提升到 55.96。 消融显示仅换模态并不足以保留文本重排序器的打分能力,需要先对齐教师分数、再在同一查询的候选集内拉开正负文档的相对分数。 表 6(a) 给出无两阶段、仅第一阶段、完整两阶段的对比;训练用 1.57M 条记录展开为 6.28M 查询—文档对做蒸馏,第二阶段用 RLHN-100K 组织候选集,视觉编码器与特征合并器冻结、仅对文本解码器加 LoRA。

在 BEIR 上平均 NDCG@10 为 55.96,超过所评估的全部 4B 以下文本重排序器以及部分更大模型,同时平均每对输入 token 为 290.07。 相对 zerank-2-reranker 与 LightOn-rerank-PW-4B 分别高出 7.66% 与 7.26% 平均 NDCG@10,而 token 用量低于所评估的文本重排序器。 表 2 列出 11 个 BEIR 数据集逐项分数与平均 token 数,基线覆盖 150M 到 4.5B 的多种架构;每个 BEIR 查询对 BM25 召回的 top 100 文档重排序,指标为 nDCG@10。

长文档场景下平均 NDCG@10 为 88.27,平均输入 token 约为所评估文本重排序器的一半,并在四个数据集上取得所比较模型中最高的吞吐。 在 MLDR 上 NDCG@10 99.74、平均约 4.20K 输入 token;在三个 LongEmbed 数据集上比最省 token 的文本基线少用 53–57% 输入 token,平均吞吐 4.51 PPS 对最快基线的 2.66 PPS。 表 4 给出 MLDR、2WikiMQA、QMSum、SummScreenFD 的 NDCG@10、token 数与 PPS;固定长度预算实验(2K/4K/8K)显示 RenderRank 在三种长度下均为最高,2K 时 97.9 已超过 gte-reranker 与 LightOn-PW-4B 在 4K 的 95.8 与 97.3。

启示与展望

这项工作面向以文本查询检索文本候选文档的重排序场景,适用于候选文档可预先渲染并缓存视觉嵌入的部署方式;论文明确假设文档图像的视觉嵌入已提前算好,缓存设置下吞吐为 76.83 PPS,而把视觉编码计入测量时为 37.31 PPS。评测覆盖 11 个 BEIR 数据集与 MLDR、2WikiMQA、QMSum、SummScreenFD 四个长文档数据集,查询保持文本形式,文档渲染为图像。渲染配置(字号、行距、图像尺寸)决定压缩程度,论文用问答与摘要任务上的表现和 token 效率选定 12pt、行距 1.0,并指出该权衡可按需调整:字号从 10pt 增到 14pt 时平均输入长度约从 236 增至 370 token、吞吐约从 94 降至 63 PPS,而 NDCG@10 从 55.04 升到 56.43。对希望降低重排序算力或把更长文档纳入固定长度预算的检索系统构建者,这些结果提供了可复现的起点。

渲染配置的影响在不同模型与任务间并不一致:论文报告在 12pt 下把行距从 1.0 增到 1.2 会提升 Qwen 在 Multi-News 上的分数,但 token 节省从 42.66% 降到 27.92%,而 Gemma 在 12pt、行距 1.2 时用掉比文本基线更多的文档 token 却未达到其表现。估算 TFLOPs 与实测吞吐并不总是一致,论文指出 RenderRank 每对估算 TFLOPs 高于 LAMAR-600m,但吞吐 76.83 PPS 高于后者的 67.55 PPS,且计算成本差异也反映主干规模与注意力结构。结果来自每个配置的单次训练运行,随机种子设为 42。视觉嵌入预计算这一前提在真实服务中的缓存与 I/O 成本如何计入,以及压缩视觉表示在 BEIR 与长文档数据集之外的语料与语言上的表现,仍是值得继续观察的问题。

来源