脚本感知稀疏专家混合:一个模型读十种文字
核心概要
该工作构建了覆盖10种文字、229种语言的合成场景文本数据集TextMuSS-10M与真实评测集TextMuSS-Bench,并提出ScriptMoE——共享单一视觉编码器、以图像级路由器激活Top-2脚本对齐专家并保留一个常开共享专家的稀疏混合专家识别器,在TextMuSS-Bench上取得82.06%的平均准确率(较最强STR基线高1.31%),并在CC-OCR端到端多语言任务上仅替换PP-OCRv5的识别器即把F1从65.71%提升到80.89%。
深度剖析
构建了TextMuSS-10M合成数据集与TextMuSS-Bench真实评测基准,为真实数据稀缺的文字提供均衡监督。 论文指出SynthMLT是当时唯一可用的多语言合成STR数据集,但其规模、质量与语言覆盖(仅MLT2019的十种语言)不足以支撑高精度训练;作者基于UnionST合成引擎为每种文字合成100万样本(共1000万),并合并十种文字的字符合集为19,684个字符(含空格)的统一词表。 数据侧证据来自消融表:仅用真实数据训练在俄语、泰语、藏语上为0.00,说明这些文字缺乏真实监督;仅用合成数据在MLT2019平均上比仅用真实数据高2.49%,合成加真实比仅用真实高8.40%。
提出ScriptMoE:共享一个视觉编码器,用图像级路由器把每张图分派给Top-2脚本对齐专家,并保留一个始终激活的共享专家承载跨脚本知识。 论文将十种文字按字形相似度归为四组(字母组Latin+Cyrillic、CJK组、阿拉伯字母族、Others组),路由器每张图只做一次决策而非每个token一次;与MRN等增量多语言方案为每种语言维护独立特征提取器、参数量随语言数线性增长不同,这里专家参数固定为4个。 模型消融显示:无专家的纯AR基线平均80.75%,4专家达82.06%,10专家反而降到81.32%;去掉共享专家降至81.35%(阿拉伯语-3.62%、藏语-3.65%),去掉脚本分类信号降至81.63%。
在统一训练协议下系统评测一体化多语言STR,ScriptMoE在TextMuSS-Bench取得最高平均准确率,并在端到端OCR中超过专家系统与强VLM。 论文将15个STR基线与9个通用OCR系统在相同数据、相同轮数下重训并重评;通用/OCR专用VLM为零样本评测。ScriptMoE平均82.06%,较最强基线SVTRv2-AR高1.31%,增益集中在阿拉伯语(+2.98%)、泰语(+2.40%)、藏语(+1.96%)。 端到端CC-OCR多语言任务中固定PP-OCRv5检测器、仅替换识别器,F1由65.71%升至80.89%,略高于最强零样本通用VLM Qwen3.5-9B的80.73%、OCR专用VLM Qianfan-OCR的76.70%与GoogleOCR的71.78%;论文称后者参数量高约百倍。效率上每次前向激活41.13M/45.85M参数(89.69%)。
验证路由器确实学到了脚本对齐的专家分工,而非任意划分。 论文用四路脚本分类头(与路由器共享池化视觉表示但不共享权重)以交叉熵监督,权重设为0.1;并给出每个脚本组代表性样本行的路由器softmax与有效专家混合可视化。 超参扫描显示该权重过强同样有害:0.2与0.5时平均降至81.44%与81.35%,藏语在0.5时降至84.55%;共享专家宽度比0.5已基本恢复全部收益,增至1.0无额外帮助。
启示与展望
该结果面向需要在单一模型中服务多种文字的场景文本识别与端到端OCR部署,尤其是真实数据稀缺的长尾文字;论文的合成数据与训练协议、四组专家划分、图像级Top-2路由与0.1的脚本分类权重是复现该结论的前提。论文还报告在中文BCTR(86.85%平均,较SVTRv2-AR高0.92%)与英文Union14M-Benchmark(88.95%平均,高0.28%)上保持竞争力,说明多语言增益并非以牺牲高资源文字为代价。作者提出后续方向包括持续学习以在不重训全模型的前提下加入新文字,以及与更强的文本检测器结合。
论文自述三点局限:合成数据与真实图像之间仍存在域差;拉丁与西里尔同形字混淆被缓解但未完全解决,俄语在合成加真实设置下为61.20%,低于仅合成时的68.13%;端到端流程仍受上游PP-OCRv5检测器制约,漏检与误检在拉丁文字严格词级评测下最明显。此外,TextMuSS-Bench新增的俄语、泰语、藏语由各文字单一专家标注,再由一位非该低资源语言专家做形态层面复核,标注一致性可作进一步观察;论文也指出跨脚本存在权衡,优化总体准确率会牺牲个别文字的峰值。
