跳到主要内容
返回时间线
arXiv来源发表:

FocusVTC 用自适应分辨率把长文本渲染成低 DPI 页面再按需放大局部,在 RULER v1 上以约 2.9 倍压缩拿到 87.4 分,超过 Glyph 的 57.5

核心概要

FocusVTC 提出一种自适应分辨率的视觉文本压缩框架:先用低 DPI 页面图像保留全局覆盖,再通过工具调用把推理中定位到的相关区域以对齐的 144 DPI 高分辨率重新读取,并用 29.4K 条把推理轨迹与页码和边界框关联的 REL-CoT 数据做多分辨率监督微调与 GRPO 训练,从而在 72 DPI 下于 RULER v1 取得 87.4 分(Glyph 为 57.5)、LongBench 56.40 分(文本输入骨干为 55.86)、MRCR 宏平均提升 13.91 分、VTCBench 宏平均 51.19,同时 MMMU 从 65.12 升至 66.73、MME 从 2424.02 升至 2457.62。

AI-generated editorial illustration: FocusVTC: Efficient and High-Performance Visual Text Compression with Adaptive Resolution

深度剖析

提出自适应分辨率的视觉文本压缩框架,把压缩的低 DPI 全局视图与工具介导的局部高分辨率读取结合起来,打破固定分辨率下压缩率与可读性的绑定。 此前的视觉文本压缩工作(如 Glyph、DeepSeek-OCR、VisInContext、VIST)在固定分辨率下渲染,局部可读性受制于全局视觉 token 预算;FocusVTC 让全局覆盖与精确局部阅读使用不同分辨率。 论文给出问题形式化(低 DPI 全局视图、Enhance_Region(page, bbox) 工具、对齐的 144 DPI 增强源),并在 RULER 48–144 DPI 扫描中显示对初始分辨率远不如固定分辨率基线敏感,72 DPI 下 v1/v2 为 87.38/75.94,而同一骨干无裁剪为 37.40/44.64。

构建 29.4K 条 Reasoning–Evidence Localization 思维链数据(REL-CoT),把推理轨迹与页码索引和归一化边界框关联,并据此做多分辨率 REL-SFT 与 GRPO 两阶段训练。 REL-CoT 由 DeepSeek V4 Flash 过滤常识可答问题、Gemini 3.5 Flash 生成带页码与框的推理轨迹、GPT-5 mini 独立校验所选区域是否支持参考答案,形成跨模型三段式流水线;REL-SFT 在七种渲染分辨率上联合监督推理、证据定位与答案生成,GRPO 则学习何时何地增强以及何时停止,且不需要单独的持续预训练阶段。 论文报告 29,411 条 REL-CoT 示例经分辨率扩展得到 205,877 个候选 SFT 样本;消融显示 REL-SFT 为 GRPO 提供有效初始化(LongBench 49.30 升至 56.40),GRPO 后 FocusVTC 在全部九项聚合指标上超过 w/o GRPO+tools(RULER v1 由 22.98 升至 87.38)。

在长上下文基准上以压缩视觉输入取得强结果:RULER v1 87.4、LongBench 56.40、MRCR 宏平均提升 13.91 分、VTCBench 宏平均 51.19,并保持通用多模态能力。 LongBench 上 56.40 略高于文本输入骨干 Qwen3.5-9B 的 55.86,且比同一骨干固定 72 DPI 高 20.54 分;MRCR 两/四/八针平均为 60.76/45.21/30.71,对比 Glyph 的 42.63/25.97/16.57;VTCBench 在 Retrieval 与 Memory 平均上最佳。 增益集中在 QA 与合成检索等由少量段落决定答案的任务,摘要类变化不大,少样本结果混合;通用多模态六项基准均较 Qwen3.5-9B 提升(MMMU 65.12→66.73,MME 2424.02→2457.62)。

给出渲染保真度与效率的量化证据:字体与字号选择影响下游分数,72 DPI 在压缩与性能间最平衡,在线端到端延迟显著下降。 在 15 种字体、8 种字号的随机文本字符错误率扫描中,DejaVu Sans 与 Verdana 最早在 9 pt 满足 5% CER 判据,DejaVu Sans 在满足判据的字体中视觉 token 成本最低(32K token 上下文 8,368.4 对 8,417.8),并在易混序列上 CER 低 0.30 个百分点;匹配设置下 DejaVu Sans 把 LongBench 从 54.93 提升到 56.40。 72 DPI 下 RULER v1 平均 2,154 个提示 token 加 723 个额外观测 token,合计约 2,877,相对 8,400 token 文本上下文约 2.9 倍压缩;MRCR 最长区间文本参考 197,909 token、提示 53,181 token,加观测后约 3.7 倍压缩;64K–128K 四针 MRCR 上在线延迟由 187.09 秒降至 67.06 秒。

启示与展望

这项工作面向需要在长文档、多文档问答与长交互历史中做检索与推理的场景,适用于具备视觉编码器与工具调用能力的多模态模型;其设定是 9B 参数骨干、29.4K 条 REL-CoT 监督、72 DPI 默认评估分辨率与 144 DPI 增强源。对读者而言,它意味着长上下文系统可以在更少输入 token 下保留全局覆盖,并把细节开销只花在推理真正需要的区域;论文也把扩展到更大骨干、更多样文档与更大上下文尺度列为后续方向。

论文自述当前研究受模型与训练数据规模限制,更大骨干与更多定位监督的收益尚待确立,长上下文压缩还需覆盖更多语言、版面与推理需求。消融显示增益集中在由少量段落决定答案的 QA 与合成检索任务,摘要类变化不大、少样本结果混合,VTCBench 的 Reasoning 平均仍低于固定分辨率骨干,因此自适应裁剪在哪些任务形态上最有效仍是开放问题。此外,本证据包为论文全文的解析文本,图表以文字与表格形式呈现,若需核对图中细节仍需回到原文。

来源