VTR-Bench 用 300 条提示、1202 个文本块测 11 个视频生成模型,最强模型整体词错误率仍为 0.250
核心概要
研究者构建了 VTR-Bench 基准,把广告、科学、用户界面、文化、日常生活五类场景中的指定文本与承载物写入 300 条提示(共 1202 个文本块),用载体特定转写计算词错误率(WER)、用每题 20 问的链式查询计算 Video Score,并配套提出由 Director 智能体协调图像生成、运动规划与视觉反馈的关键帧引导智能体框架;在 11 个最先进模型上评测发现场景文本渲染普遍困难,最佳模型整体 WER 为 0.250,而该框架在 Minimax H3 上把整体 WER 从 0.4468 降到 0.3015(相对下降 32.5%)并提升 Video Score。
深度剖析
VTR-Bench 把“文字是否被正确渲染”从视频生成的通用质量评价中单独拆出来,作为一项独立能力来测。 此前的视频生成基准主要评估视觉质量、提示对齐、组合性与物理合理性,明确涉及渲染文本的 EvalCrafter、T2VTextBench、AVGen-Bench 多覆盖短文本目标,长段落覆盖有限,且 T2VTextBench 完全依赖人工评估;VTR-Bench 覆盖从短标签到长段落的多文本目标,并给出参考字符串与承载物标注。 300 条提示在五类场景中每类 60 条,共 1202 个文本块,每题 2 至 6 块、94.3% 的提示要求 3 至 5 块;每条视频所需文本总长 58 至 496 个 token(中位数 102.5),单块 1 至 275 个 token(中位数 23)。
评测流程把“文本保真度”与“场景和运动要求”解耦,两条分支都做了人工对齐验证。 文本分支由视觉语言模型按承载物描述转写最清晰的一次出现,与参考文本比较 WER;视频分支为每条提示构造 20 个问题的链式查询,覆盖场景属性、运动遵循、空间关系、实体存在、时间一致性五个维度,Video Score 为满足要求的比例。 在 100 个抽样视频、2000 条链式查询判断与 404 个文本块上,自动评测与三人多数投票在 92.15% 的查询上一致;文本块 WER 的 Pearson 为 0.9541、Spearman 为 0.9370、Lin's CCC 为 0.9536、MAE 为 0.0545,视频级 WER 的 Lin's CCC 为 0.9835、MAE 为 0.0407。
11 个最先进模型普遍难以准确渲染场景文本,且高 Video Score 并不保证文本正确。 结果把“场景与运动要求被满足”和“文字内容正确”区分为两种不同能力:Kling v3.0 与 Seedance2.5 的 Video Score 都约为 0.79,WER 却分别为 0.979 和 0.641;Minimax H3 的 Video Score 低于多数专有模型,WER 0.447 却优于它们。 开源模型中 Minimax H3 的 WER 为 0.447,其余多数接近指标上界;专有模型中 Wan3.0 在五个场景的文本保真度均领先,整体 WER 0.250,Seedance2.5 为 0.641;换用 Qwen3.6-27B 评测器时 11 个模型的 WER 与 Video Score 排序完全一致。
关键帧引导智能体框架通过视觉反馈迭代改进,在推理阶段同时改善文本保真度与视频要求满足度。 Director 智能体先构造图像提示并请求候选首帧,由视觉语言模型检查文本准确性、可读性、承载物覆盖与场景一致性,再决定比较候选、改写提示或定向编辑;随后构造运动计划并让视频生成器在相同权重下生成,再依据采样帧的文本稳定性、承载物持续性、运动连贯性等反馈继续优化。 在 Minimax H3 上,整体 WER 从 0.4468 降至 0.3015(相对下降 32.5%),Video Score 从 0.7562 升至 0.8315,五个场景两项指标均改善;相对仅用首帧条件的 I2V,完整框架整体 WER 再相对下降 9.4%,并在每个场景取得最高 Video Score。
启示与展望
这项工作面向需要视频中文字准确传达信息的场景,例如广告、科学演示与用户界面,评测对象是给定提示下模型在指定承载物上渲染指定文本的能力。基准提供 300 条提示、1202 个文本块与参考字符串,配套的自动评测流程与人工判断高度一致,因此可用于规模化比较模型、追踪改进,也可作为关键帧引导智能体框架这类推理阶段控制方法的测试台。关键帧引导框架在 Minimax H3 上验证,使用 Qwen3.7-plus 作为 Director 智能体与视觉语言模型、Qwen-Image-3.0 作为图像生成器,说明在相同视频生成器权重下,显式首帧构造与视觉反馈可以同时改善文本保真度与场景运动满足度。
评测覆盖 11 个模型与五类场景,但文本长度、承载物类型与运动复杂度的组合空间很大,哪些因素最影响文本保真度仍是开放问题。失败分析显示不可读文本常与字符细节不足相关(small 与 blurry 分别出现 3595 与 3196 次),可恢复文本中又出现拼写错误与乱码(misspelled 602 次、garbled 480 次),说明“能转写”与“内容正确”是两件事,后续需要分别追踪。分辨率与时长的影响只在 Minimax H3 与 LTX-2.3 上比较:提高分辨率降低了 Minimax H3 的 WER,而 LTX-2.3 在四种配置下 WER 都接近 1,缩短时长没有带来一致改善,因此生成设置能在多大范围内替代底层文本渲染能力,尚待更多模型验证。关键帧引导框架的增益在 Minimax H3 上测得,且 UI 场景中 I2V 的 WER 最低而完整框架 Video Score 最高,说明不同场景的最优策略可能不同。此外,本总结依据的是论文全文与首页证据包,未包含代码仓库中的实现细节与全部附录表格。
