复旦团队用IDS拆解汉字结构做奖励,让Qwen-Image在LongText与GenTextEval上结构质量与语义对齐双双领先
核心概要
该工作提出IDSpect:先用Unicode 16.0 BabelStone词典把目标汉字递归拆解为表意文字描述序列(IDS)令牌,再训练一个基于SVTRv2与NRTR解码器的专家IDS识别器,把生成图像中的文字区域直接转写为IDS序列,通过全局唯一令牌信用的令牌级F1与整字语义奖励加权融合,在GRPO后训练Qwen-Image时不改动生成器、不增加推理开销,在LongText与GenTextEval上取得领先的结构质量与语义对齐。
深度剖析
论文指出基于OCR的强化学习奖励把汉字当作原子字符比较转写文本,因而对“只错一个部件或空间关系”的部分结构进展给出同样粗糙的反馈,甚至可能因语言先验从畸形字形中猜出目标字而产生假阳性。 此前TextPecker等结构感知评估器能定位异常字形但把错误字统一替换为“#”,一旦折叠为异常标记,正确与错误的内部结构便不再被区分;该工作把奖励的粒度从整字推进到部件与空间算子。 论文用同一张生成图像中的失败案例说明两种失效模式:专家OCR按局部外观给出视觉上合理但错误的字,字符级奖励贡献为0.00;全局MLLM OCR借助上下文恢复目标字,给出1.00的假阳性局部贡献;TextPecker正确判为结构异常但局部贡献仍为0.00,而IDSpect保留匹配的IDS令牌信用、惩罚不匹配令牌,给出0.22的独立IDS奖励。
作者构建了专家IDS识别器:以SVTRv2为视觉骨干、NRTR式Transformer解码器自回归预测IDS词表,把文字区域图像直接映射为空间算子与可复用部件的令牌序列,而非先识别整字再做符号分解。 以往中文OCR工作用部首、笔画与IDS识别生僻或未见字符,该工作把IDS读取器当作奖励模型使用,用其结构化输出优化生成模型,并强调奖励效用取决于中间分数能否把部分正确与畸形字形排成有用的顺序。 训练数据为IDSynth-1M——一百万个渲染场景文字图像,字符在所选中文字体覆盖的字符集上近似均匀采样,以抑制自然词共现带来的语言捷径;递归分解深度上限为10,最大解码IDS序列长度为100令牌。
IDSpect把每个检测到的文字裁剪块与目标IDS序列的候选跨度做半全局编辑对齐、非极大值抑制去重与全局分配,使每个目标位置只能获得一次精确匹配信用,从而对检测区域顺序不敏感,并以令牌级F1作为组合奖励,与整字语义奖励等权相加。 直接拼接依赖检测器顺序,TextPecker式的逐字匹配丢弃字间顺序信息;裁剪块级对齐在保留块内IDS令牌顺序的同时建立局部区域与目标跨度的对应。 消融显示裁剪块级对齐取得最高Sem. 0.911,比直接拼接与逐字匹配分别高0.025与0.012,Qua. 0.979仅比按裁剪块一致性低0.001;按裁剪块一致性虽Qua.最高0.980,但Sem. 0.901低于目标IDS参照的0.911。
在Qwen-Image上用Flow-GRPO与Flow-Factory框架、LoRA适配器做后训练后,IDSpect在LongText与GenTextEval上同时提升结构质量与语义对齐,超过通用OCR奖励与TextPecker。 相对OCR奖励,GenTextEval上Qua.与Sem.分别高出0.026与0.037;相对TextPecker奖励高出0.006与0.014;LongText上取得最高Qua. 0.975与Sem. 0.928,Avg. 0.972与TextPecker相当。 基线包括冻结模型、OCR-only GRPO与TextPecker引导的GRPO,按TextPecker中文评测协议在LongText-Bench与GenTextEval-Bench上报告原始文本分数、结构质量与语义对齐;定性比较覆盖三条含多文字区域、不同长度与空间排布的提示词,长文本行改善尤为明显。
启示与展望
该结果面向以中文表意文字为渲染目标的文生图后训练场景:在GRPO阶段用IDS结构奖励与整字语义奖励的加权和引导Qwen-Image,训练完成后两个奖励分支均被丢弃,因此不改变图像生成器、也不增加推理时开销。它适用于需要评估“部件与空间关系是否忠实”的场合,例如招牌、海报等含多文字区域、不同长度与空间排布的长文本行。作者在结论中把扩展到更广的汉字覆盖以及日文、韩文等多语种文字列为后续方向,说明当前设定以已覆盖的汉字集合与所选字体为前提。
IDS识别器在自然分布文本上可能先识别为高频字再复现其规范IDS,从而把IDS预测退化为字符识别;论文用近似均匀采样与抑制词共现的合成数据来削弱这一捷径,但这一设计在真实长尾字形上的表现仍是读者会关注的问题。按裁剪块一致性的Qua. 0.980高于目标参照的0.979,而Sem. 0.901低于0.911,说明结构一致性与目标对齐之间存在需要权衡的空间。此外,评测沿用TextPecker的中文协议并包含已发表的Qwen-Image、OCR奖励与TextPecker结果用于直接比较,读者若关心不同评测协议下的可比性,可把这一点作为进一步观察的方向。
