跳到主要内容
返回时间线
arXiv来源发表:

OmniVBench 与 Omni-R2V:为“全能参考到视频”建立评测与训练的共同底座

核心概要

该工作提出 OmniVBench 基准与 Omni-R2V 数据集,用 7 个任务族、18 个细粒度任务、813 个评测案例和 12,172 条基于参考因子的清单条目来评测全能参考到视频生成,并释放 340K 条经处理的训练样本,对多个开源与闭源模型的评测显示各任务族与各评测维度之间存在明显性能差距。

AI-generated editorial illustration: OmniVBench: A Benchmark and Large-Scale Dataset for Omni Reference-to-Video Generation

深度剖析

提出 OmniVBench,把参考到视频评测从以内容参考为主扩展到内容、运动、风格、结构、叙事五个单参考维度以及多内容与跨维度两类多参考设置,共 7 个任务族、18 个细粒度任务、813 个评测案例。 相较既有基准(如 OpenS2V-Eval、VACE-Bench、UniVBench、IntelligentVBench、FashionVideoBench)主要覆盖内容参考,该基准在表格中同时勾选了内容、运动、风格、结构、叙事与多参考全部类别。 任务分类与案例数量在正文与附录表 A.1 中逐项列出(如内容 112、运动 95、风格 43、结构 108、叙事 120、多参考 335),所有样本经三名标注者人工核验。

提出基于参考因子的评测协议,把每个案例拆解为案例专属清单,显式判断参考因子是否被忠实保留、正确解耦并绑定到目标、以及是否按指令实现,共 12,172 条清单条目。 既有评测多依赖固定相似度指标或对参考一致性的整体式 VLM 判断,该协议把参考保真度、指令实现与视频质量分开,并在参考保真度下细分内容、结构、运动、风格、叙事五个子维度。 在覆盖全部 7 个任务族与 18 个子任务的 100 个案例、965 个模型输出上做人工评测,自动评测与人工判断在 RF、IR、VQ 上分别达到 Pearson 0.81/0.78/0.86、Spearman 0.77/0.74/0.82;基于因子的清单在 RF 与 IR 上的 Spearman 分别为 0.77 与 0.74,高于整体式评测的 0.67 与 0.69。

构建并释放 Omni-R2V 数据集,包含 339,570 条(约 340K)经处理的训练样本,覆盖 7 个任务族、图像与视频两类参考模态,并给出任务专属的参考—目标配对与指令生成流程。 既有数据集(OpenS2V-5M、Phantom-Data、MuSS)以图像参考和内容任务为主,该数据集在表格中同时覆盖内容、运动、风格、结构、叙事、多内容与跨维度任务,且直接提供处理后的参考—视频对。 数据来自内部专业视频语料并补充公开数据,经源视频处理、任务专属配对构建、候选过滤与指令生成四步流程;片段时长可达 20 秒,分辨率覆盖至 1080p 与 2160p+;人工抽检约每族 100 个样本,三项标准平均通过率分别为 95.4%、97.0%、94.2%。

对 11 个先进开源与闭源模型进行评测,发现没有模型在所有任务族上一致表现优异,内容参考得分普遍较高,而运动、风格、结构、叙事与多参考设置上差距更大。 该评测把参考保真度、指令实现与视频质量显式拆开,并进一步拆出参考因子解耦与路由、目标合规两个子维度,从而暴露出整体式评测难以区分的差异。 结果以表格形式给出各任务族与总体得分,例如开源模型中 MiniMax H3 总体 72.41、Bernini 56.95,闭源模型中 Seedance 2.5 总体 72.68、Gemini Omni 70.76;多个模型在目标合规上得分较高而在解耦与路由上明显偏低,尤其在多内容与跨维度任务上。

启示与展望

该工作面向参考到视频生成的研究与工程场景:评测侧适用于需要诊断参考因子保留、解耦与路由、以及多参考组合能力的模型比较;数据侧适用于以图像或视频参考、单参考或多参考组合为条件的训练。基准与数据集互不重叠,因此可分别用于评测与训练;任务专属配对流程与清单式协议也可迁移到其他参考条件生成任务。

清单式评测依赖 VLM 作为评判者,其在不同任务族上的稳定性仍值得持续观察;视频质量维度由 DOVER++、Aesthetic Predictor V2.5 与 UnifiedReward 2.0 分别计算,与参考保真度和指令实现相互独立,三者如何共同解释模型能力仍有讨论空间;此外,数据构建中部分环节使用生成模型合成参考,这类参考与真实拍摄参考之间的差异对训练效果的影响,是后续可以继续追踪的问题。

来源