跳到主要内容
返回时间线
arXiv来源发表:

PlaylistEval 用约 100 小时播放列表测试视频语言裁判:最强模型仅 75.4% 成对准确率,人类一致率 93.0%

核心概要

该工作提出 PlaylistEval 这一无需人工标注的智能体式基准构建框架,在七个领域各约 100 小时的播放列表上自动生成证据分散于两段远距离片段、且错误答案仅在画面层面可区分的偏好对,得到含 630 对样本的 PlaylistBench;在 152 对分层子集上其偏好与人类判断一致率为 93.0%(IAA 0.781),而评测 8 个家族共 17 个全模态与多模态模型时,前沿裁判的成对准确率仅 75.4%,开源裁判模型明显落后,检索可将准确率提升最多 10.5 个百分点但最佳检索器仅在 37.9% 的情况下把两段相关片段同时排进前 10,且裁判准确率随播放列表规模从约 1 小时增至 100 小时而持续下降。

AI-generated editorial illustration: PlaylistEval: Can Video-Language Judges Be Trusted at Day Scale and Beyond?

深度剖析

PlaylistEval 把裁判基准的构建从人工标注转为自动流水线:Phase I 生成证据分散于两段远距离片段、且金标答案逐条标注支撑时间跨度的问题,Phase II 通过受控的视觉退化生成四个仅凭转录文本无法区分的错误答案,两阶段的校验门把拒绝理由回传给生成器形成自纠正循环,成本约每问 1 美元。 既有视频裁判基准的视频多为几分钟、答案对常可仅凭转录文本区分,且依赖昂贵人工标注;该工作把长度、视觉接地与可扩展性三个问题分别交给两个生成阶段与反馈循环处理,并可在任意新播放列表上重跑。 论文给出两阶段流程、三类校验门(结构有效性、视频必要性、视频充分性;以及结构有效性、文本不可检测性、视觉可检测性)与跨家族生成器—验证器配置,并报告约每问 1 美元的成本;具体提示词与各阶段输入见附录。

所得 PlaylistBench 含 630 对偏好对,覆盖 Education、Drama、Life、Art、History、Documentary、Podcasts 七个领域,兼顾静态事实与动态叙事知识;在 152 对分层子集上,基准偏好与人类判断一致率为 93.0%,标注者间一致性 IAA 为 0.781。 该基准在保留与人类判断高一致率的同时不依赖人工标注,且每个偏好对都要求跨集合检索,而非在单一短片段内即可判定。 人类一致性在分层抽样的 152 对上测得,论文同时报告 IAA 0.781;领域覆盖与约 100 小时/领域的规模来自人工选定的播放列表集合。

评测 8 个家族共 17 个全模态与多模态模型显示,前沿裁判的成对准确率仅 75.4%,开源裁判模型明显落后;检索可带来最多 10.5 个百分点的提升,但最佳检索器仅在 37.9% 的情况下把两段相关片段同时排进前 10;仅用画面或仅用转录文本相对两者并用损失若干百分点,而单纯增加推理预算或提高视觉分辨率收益有限。 这些失效模式在日尺度及以上才显现,此前的短片段基准无法覆盖;论文据此指出瓶颈在于找到证据而非看清证据。 结论来自对 17 个模型与 4 个检索器的统一评测,并配有随播放列表长度从约 1 小时到 100 小时的准确率下降曲线;具体逐领域数值见论文表格。

在短片段上训练的短视频奖励模型在该设定下表现接近随机水平,说明短视频裁判能力难以迁移到日尺度视频;此外当两个答案交换位置时,较弱裁判(如 Gemma-4-26B-A4B 与 Gemini-3.5-Flash-Lite)在约一半的偏好对上反转判断,而较强裁判(如 Qwen-3.8-Max 与 Gemini-3.7-Flash)大体保持一致。 该结果把裁判可靠性问题从“准确率高低”扩展到“答案顺序敏感性”与“训练分布迁移”,并显示顺序稳健性与裁判强度相关。 顺序交换实验在成对偏好上统计反转比例,短视频奖励模型结果来自同一评测协议;论文以举例方式点名了强弱裁判的具体模型。

启示与展望

该工作面向需要跨集合检索的日尺度视频裁判评测:适用于以播放列表为单位、证据分散于两段远距离片段、且错误仅在画面层面可区分的偏好判断场景,服务对象是构建长视频评测与训练视频奖励模型的研究与工程团队。其流水线设计为可在新播放列表上重跑,因此也可用于持续扩充或重建基准;论文同时释放流水线、基准与评测代码。

仍可继续观察的是:人类一致性只在 152 对分层子集上测得,其余偏好对未做人类核验;检索上限与裁判准确率之间的关系在更长集合上如何变化尚未给出;短视频奖励模型接近随机的结论基于当前评测协议,其在不同训练数据与规模下的表现仍是开放问题。此外,本次载入的论文正文在评测表格处被截断,逐领域与逐模型的完整数值需回到原文表格核对。

来源