RULER 用逐指令六项评分表做强化学习奖励,把 Qwen3-8B 的 SVG 生成评分从 0.432 提到 0.693,追平更大的 DeepSeek-V3
核心概要
该工作先用 900 个由 Claude-Opus-4.6、Qwen3-32B、Qwen3-8B 生成并经人工打分的 SVG 样本证明,让视觉语言评判模型按多轴评分表打分,与人类判断的相关性(Spearman 0.7929、Goodman-Kruskal Gamma 0.7574)远高于 CLIP 与美学分数等标量指标,随后提出 RULER:仅凭文本指令为每条指令生成六项实例化评分表,由评判 VLM 对渲染结果逐项打分并加权成奖励,用 GRPO 优化策略,在 MMSVG-Illustration 与 MMSVG-Icon 上把评分表分数从 Qwen3-8B 基线的 0.432 和 0.395 提升到 0.693 和 0.683,超过专用 SVG 模型并追平
深度剖析
该工作把开放式 SVG 生成的质量评估从单一标量改为多轴评分表,并给出与人类判断对齐的量化证据:在 900 个渲染样本上,评分表打分的样本级 Spearman 相关为 0.7929、成对排序一致性 Goodman-Kruskal Gamma 为 0.7574,均高于美学分数与 CLIP。 此前 SVG 生成常用 CLIPScore、美学分类器、HPS 等标量指标,而这些指标在自然图像上校准,迁移到风格化矢量内容时表现不佳;该工作系统比较了评分表与标量指标在同一样本集上的人类对齐度。 900 个渲染 SVG 样本,来自 Claude-Opus-4.6、Qwen3-32B、Qwen3-8B 三个能力不同的模型各 300 个,由十位标注者给出 0–100 的整体质量分,三位校验者复核;对齐分析使用 GPT-5-mini 配统一评分表,与训练时使用的 Qwen3-VL-8B 评判模型相互独立。
RULER 把每条指令转成六项实例化评分表,覆盖语义保真、视觉质量、渲染风格三个轴,由评判 VLM 对每个渲染结果逐项打分,加权归一化后作为密集奖励,用 GRPO 的组内相对优势更新策略。 此前的通用评分表对所有查询使用同一套清单,无法反映指令特有的正确性;RULER 的评分表只由文本指令生成,因此既不需要配对 SVG 真值,也不需要人类偏好标签,同时保留开放式解空间。 评分表生成提示明确要求保持开放、禁止对几何、位置、颜色、部件数量等实现细节提出精确重建要求;训练用 30,737 条提示–评分表对(MMSVG-Icon 19,531 条、MMSVG-Illustration 11,206 条),经格式与质量过滤,理想 SVG 得分低于 0.9 的评分表被剔除。
在 MMSVG-Illustration 与 MMSVG-Icon 上,RULER 把评分表分数从 Qwen3-8B 基线的 0.432 和 0.395 提升到 0.693 和 0.683,超过专用 SVG 模型(如 OmniSVG-8B 的 0.288 和 0.565)并追平规模大得多的 DeepSeek-V3(0.686 和 0.673),同时在 CLIP、美学、HPS 等常规指标上保持竞争力。 该结果说明在开放式视觉代码生成上缩小质量差距不只靠扩大 SVG 专用预训练;一个 8B 模型在实例化评分表奖励下可以达到更大规模模型的视觉质量水平。 两个基准上的对比表覆盖扩散优化方法、基础大模型与 SVG 专用模型三类基线;另有 150 条 MMSVG-Bench 提示的盲测成对人工偏好研究,RULER 对五个基线的非平局胜率均超过 50%,从对 VectorFusion 的 53.3% 到对 JanusCoder 的 96.5%。
奖励设计消融显示,评分表设计本身是 RL 在开放式 SVG 生成上的有效杠杆:去掉视觉质量轴造成最大降幅,去掉渲染轴次之,去掉语义轴降幅最小;而换成更严格、去掉风格轴并附加文本提示惩罚的 Rubric-S 后,评分表分数降到 0.536,并出现把提示文字画进 SVG 的文本捷径行为。 该工作把奖励设计的差异单独隔离出来:固定 Qwen3-8B 基线与 GRPO 优化器,只改变奖励信号,比较零样本、CLIP+美学+HPS 标量奖励、通用评分表奖励与实例化评分表奖励。 标量多指标奖励 C+A+H RL 把美学分抬到 6.697(Illustration)和 6.210(Icon),但 CLIP 下降、Icon 上的评分表分数跌到 0.262 并低于零样本,序列长度膨胀到 6.3k token,呈现奖励劫持;通用评分表奖励稳定提升但粒度较粗,与完整方法在 Illustration 和 Icon 上分别留有评分表差距。
启示与展望
该结果面向开放式文本到 SVG 代码生成,适用于没有配对 SVG 真值、也没有人类偏好标签的指令集合,训练数据取自 MMSVG-Icon 与 MMSVG-Illustration 的训练划分,评估在 MMSVG-Illustration、MMSVG-Icon 与 MMSVG-Bench 上进行。方法可直接迁移到其他需要渲染后评判的视觉代码任务,前提是能提供文本指令与一个可对渲染结果逐项打分的 VLM 评判者。评分表生成是一次性离线预处理并缓存,训练时不再查询评分表生成器,因此该流程适合先批量构建奖励规范再开展 RL 的场景。作者报告将公开生成的评分表、处理后的训练数据与代码,这为在自有指令集上复现或改造评分表结构提供了起点。
评分表由前沿模型生成、由 VLM 评判,奖励质量可能继承二者的偏好与失效模式,评判者仍可能高估表面线索或低估细微风格差异,尤其在训练分布之外的提示上。RL 每一步都要渲染采样 SVG 并调用评判 VLM,成本显著高于 CLIP 或代码启发式等轻量奖励,这可能限制其扩展到更大模型、更长 rollout 或更广的超参搜索。把质量分解为语义、视觉、风格三轴在本文基准上有效,但未必覆盖所有合法艺术意图或领域特定偏好。此外,训练与测试提示虽分别生成,仍处于同一基准分布内,作者明确不将其视为域偏移的分布外评估;评分表生成成本为每提示 0.0655 美元、总计 2,013.12 美元,这一开销在更大规模指令集上如何变化仍是开放问题。
