跳到主要内容
返回时间线
arXiv来源发表:

BoundInk 把字与字之间的边界当作显式生成单元,归一化 DTW 降低 17.6–47.8%,盲评偏好率 78.0–82.6%

核心概要

BoundInk 是一个以书写者为条件的在线手写生成框架,把相邻字符之间的边界(连笔、间距、对齐)作为显式生成目标,用 bigram 滑窗 Transformer 建模前字到当前字的局部转移并配合句级上下文门控注入,同时提出 Connectivity and Spacing Metrics(CSM)直接评估连笔连续性与字符/词间距;在三套基准匹配设置下改善全部适用的边界质量指标,归一化 DTW 降低 17.6–47.8%,盲人评中在 78.0–82.6% 的有效逐准则判断中被偏好。

AI-generated editorial illustration: BoundInk: Boundary-Aware Online Handwriting Generation

深度剖析

把字符间边界从长序列解码的副产物提升为显式生成单元:BoundInk 用 bigram 感知滑窗 Transformer 解码器在“前字—当前字”窗口上做因果自注意力并施加 RoPE,句级信息则通过位置相关的 Context Memory 与 token 级门控融合注入,从而在保留书写者字形外观的同时调整连笔、间距与对齐。 此前方法(如 DeepWriting、DSD、OLHWG)主要依赖长程序列建模隐式获得字符间行为,OLHWG 建模布局与间距但不建模跨字符的落笔延续;BoundInk 把局部边界动态与句级上下文拆成两条互补通路。 消融显示移除 Bi-SWT 后 CSM 的 F1 从 0.49 降到 0.37、SSS 从 0.71 降到 0.40、归一化 DTW 从 0.51 升到 0.60;移除门控上下文融合主要影响连笔(F1 从 0.49 降到 0.35);两者同时移除时 F1 为 0.22。

提出 Connectivity and Spacing Metrics(CSM),直接测量连笔连通性、字符间距与词间距,作为对全局轨迹相似度的补充。 常规轨迹距离(如 DTW)可能对全局相似但局部连笔错误或间距不自然的输出给出较好分数;CSM 由 F1、CRE、KGS、SSS 四个分量组成,按书写者聚合后再宏平均,KGS 与 SSS 使用重叠感知的对称对数比相似度。 论文给出定性案例说明 DTW 差异很小而 CSM 差异明显,并明确这些是挑选出的示例,不代表 CSM 与 DTW 普遍反相关。

在三套基准匹配协议下,BoundInk 改善全部适用的边界质量指标并降低归一化 DTW。 与 DeepWriting 相比归一化 DTW 从 2.70 降到 1.41,与 DSD 相比从 1.25 降到 0.99,在 OLHWG 兼容协议下 KGS 从 0.34 升到 0.40、归一化 DTW 从 0.17 降到 0.14;同时字形级 DTW 在英文协议从 1.6048 降到 1.3649、中文从 0.8789 降到 0.8718。 每个基线都按对应划分、预处理与指标实现重新训练 BoundInk,比较集基于兼容性而非穷尽;CSM 分量在协议缺少对应边界类型时报告为未定义。

盲人偏好与内容/书写者验证支持边界质量提升不以可读性或书写者一致性为代价。 30 名参与者每人 20 个随机试次,共 1800 个准则级判断,其中 1604 个有效、196 个标记为无法判断;对 DSD 取得 789 个有效判断中的 615 个偏好,对 DeepWriting 取得 815 个中的 673 个。 渲染轨迹上的 OCR 识别与基线相当,而书写者分类 Top-1 对 DeepWriting 从 35.8 升到 61.7、对 DSD 从 6.0 升到 69.0,Top-5 分别从 68.3 升到 81.7、从 27.0 升到 74.0。

启示与展望

该工作面向以书写者为条件的句级在线手写生成,适用于英文(IAM-expanded、BRUSH、IAM 与 BRUSH 合并集)与中文(CASIA-OLHWDB 2.0–2.2)等具备字符边界标注与书写者参考的场景;风格条件采用图像式字符参考,推理时不需要书写者的在线轨迹序列。对下游而言,CSM 提供了一套可直接测量连笔连通性、字符间距与词间距的评估工具,可用于比较不同生成器在边界行为上的差异;作者也把可选序列参考、更广文字系统、未见字符组合、稀缺或不匹配参考、长序列解码效率与自回归误差累积列为后续方向。

合并英文数据集用于定性、人评与消融,而基准匹配的定量比较是在各基线协议下重新训练后进行的,因此跨协议数值不宜直接横向比较。CSM 分量在协议缺少对应边界类型时报告为未定义,例如 OLHWG 兼容协议下只有 KGS 有定义。附录中的 V2 探索性分析在中间检查点比较两个模型修订版,作者明确说明该比较不是隔离单一因素的受控消融,且严格对齐子集只覆盖部分生成测试句。作者也指出仍需标准化基准来联合评估内容、风格、边界质量、可靠性与效率。

来源