跳到主要内容
返回时间线
arXiv来源发表:

SP-DocReader 用差异感知自博弈把 Qwen3-VL-4B 的 Vary-600K 字符错误率从 2.40 降到 1.11

核心概要

SP-DocReader 提出一种面向文档 OCR 的自博弈框架,用最长公共子序列对齐参考文本与模型生成文本,只在未匹配位置施加对比式相对评分与直接负对数似然监督,且仅训练 OCR 模块、冻结视觉编码器与语言主干;在 Qwen3-VL-4B 与 InternVL-3.5-4B 上,三轮自博弈相对两轮监督微调降低了 Vary-600K 字符错误率,并在 DocBank、IIT-CDIP 及 DocVQA、InfographicVQA 上取得改进。

Source-provided article image: SP-DocReader: Difference-Aware Self-Play for Precise Document OCR
Figure 1 ·

Figure 1 : Overview of the SP-DocReader training framework. A frozen opponent generates a synthetic reading of the document, and Reading Discrepancy Masking aligns it with the ground truth to isolate the errors. The main player then optimizes a dual objective that combines the Reading Discrepancy Loss for difference-aware correction with the Focused Fidelity Loss for direct supervision on the hard tokens, after which the opponent is refreshed.

arXiv

深度剖析

论文提出以差异位置为核心的自博弈目标:Reading Discrepancy Masking 用最长公共子序列对齐参考与生成 token 序列,选出双方未匹配位置,并在保留各自完整条件前缀的前提下对这些位置打分。 与全序列监督微调对每个目标位置一律施加损失不同,该方法把训练信号集中到生成阅读中真正出错的 token 上,同时不把截取出的片段当作新序列重新评分。 方法在正文第 3.2 节给出形式化定义,包括 LCS 对齐算子、未匹配位置集合与掩码对数似然评分,并在附录 C 给出动态规划递推与 EOS 处理规则。

Focused Fidelity Loss 在未匹配的参考位置补充直接负对数似然监督,与对比式 Reading Discrepancy Loss 组合成最终目标。 论文指出纯相对目标可以通过压低生成阅读得分而非提升参考得分来下降,因此需要直接监督来保证修正方向;作者还推导了组合目标的梯度以区分相对评分优化与直接监督的作用。 消融实验显示,去掉对比项后 Vary-600K CER 从 1.11 升至 1.88,去掉 FFL 后 DocVQA ANLS 从 84.89 降至 82.96,两个简化变体仍优于 SFT-2,而组合两项损失在全部五列指标上最好。

在 Qwen3-VL-4B 与 InternVL-3.5-4B 两个主干上,三轮自博弈相对两轮监督微调同时改善域内转写与零样本文档基准。 增益从训练域延伸到未做目标基准适配的 DocBank 与 IIT-CDIP,并在 DocVQA 上同步提升,说明更好的页面阅读伴随更强的文档问答表现。 Qwen3-VL-4B 上 Vary-600K CER 由 2.40 降至 1.11,DocBank 与 IIT-CDIP 的 CER 分别下降 1.90 与 2.29 个百分点,DocVQA 与 InfographicVQA 的 ANLS 分别上升 3.67 与 3.60 点;InternVL-3.5-4B 上三个阅读基准均改善,InfographicVQA ANLS 由 48.15 微变为 48.06。

模块化 OCR 微调在零样本阅读与训练成本上优于全参数微调,并在标注页面有限时表现出更高的数据效率。 全参数微调取得最低的域内 Vary-600K CER(0.98 对 1.11),但其 DocBank 与 IIT-CDIP CER 为 11.28 与 16.87,高于模块化微调的 9.05 与 14.42;模块化方案仅需 0.5B 可训练参数,而 OCR-free 与全参数微调分别为 3.3B 与 3.8B。 在 30k 训练页面预算下,SP-DocReader 的五任务 AVG 达到 82.46,超过使用 120k 页面的 SFT 的 80.73;第三轮模块化微调在相对训练成本 0.33 下达到四任务零样本 AVG 79.58,而全参数微调为 74.98、成本 1.58。

启示与展望

该结果面向单页转写场景,适用于有配对图像与参考文本、且可接受冻结视觉编码器与语言主干、仅更新 OCR 分支的设定;论文在英中双语训练页面上验证了两个视觉语言主干,并报告在 48 至 150 DPI 的测试分辨率范围内 SP-DocReader 的 CER 均低于 SFT。对希望降低标注页面需求、同时保留零样本阅读与文档问答能力的团队,这一模块化方案提供了可复用的训练流程与成本核算方式。

论文自述聚焦单页转写而非多页阅读或结构化抽取,固定生成预算可能限制较长页面的覆盖,且结果不构成对其他语言或模型族的泛化结论。附录 E 指出改进并非在所有指标上单调,例如 Qwen3-VL-4B 的 Vary-600K NED 从 SP-DR-2 的 0.988 变为 SP-DR-3 的 0.987,主比较固定采用第三轮端点。附录 C 说明掩码并不自动减少投影计算,匹配位置在内部计算中未必梯度为零,成本比较需覆盖预处理、生成、对齐与双方评分;这些是读者评估复现与部署时值得继续关注的问题。

来源