跳到主要内容
返回时间线
Google Research来源发表:

Google 提出多智能体视频协同导演框架,在 GenAD-Bench 上取得 81.4 峰值质量分并生成十分钟长视频

核心概要

Google 研究团队提出一套统一的多智能体框架(含 AI video co-director、CANVAS、A²RD、VQQA 四个组件),把长视频生成建模为全局优化与世界状态跟踪问题,在 GenAD-Bench 上取得 81.4 峰值质量分,并在 ST-Bench、HardContinuityBench、VBench-Long、LVBench-C、T2V-CompBench、VBench2、VBench-I2V 等基准上报告了多镜头叙事一致性、角色持续性与长时段稳定性的提升,同时展示了十分钟长视频生成。

AI-generated editorial illustration: Automating coherent long-form video generation

深度剖析

AI video co-director 把视频叙事形式化为全局优化问题,用分层参数化与多臂老虎机(MAB)在创意策略、叙事模式、美学原型三个维度上搜索创意配置,并由多模态 LLM Judge 给出因子化奖励信号回传迭代。 相较依赖刚性线性提示链、由独立手工提示驱动的既有智能体流水线,这里把创意方向的选择交给全局搜索与闭环反馈,使整条流水线在统一愿景下运行。 文中报告该框架在 GenAD-Bench 上达到 81.4 峰值质量分,并在 ViStoryBench 上提升故事一致性;作者同时说明架构为模型无关,可架设在任意基础生成模型之上,并指出详细架构、训练配置与基线对比需参见各篇单独论文。

CANVAS 通过维护角色、地点与物体状态的结构化表示和持久视觉记忆,在需要复现场景时检索或新建视觉锚点,从而在多镜头叙事中显式规划视觉连续性。 相较直接使用基础模型(Gemini-3.1-Pro)生成或另一多智能体框架(AutoStudio),文中以博物馆盗窃序列为例说明:前者出现道具不一致与背景漂移,后者出现角色漂移(小偷的帽子消失)与背景不一致,而 CANVAS 的持久视觉记忆使角色、空间几何与物体状态在整个叙事中保持连贯。 证据来自文中展示的对比图例(连续转场与非连续转场两类情形)以及在 ST-Bench 与 HardContinuityBench 上报告的跨场景重现连续性增益。

A²RD 采用逐段生成加多模态视频记忆的智能体自回归架构,每段执行检索—合成—精修—更新循环,并在外推(推动剧情前进)与插值(把段落锚定到已有实体与环境)之间自适应切换。 相较标准视频生成器在长时段上出现严重视觉衰减(角色变异、场景变形),A²RD 持续查询多模态视频记忆以维持角色身份、服装细节与结构几何。 文中以一段十分钟长视频作为演示,并在 VBench-Long 与 LVBench-C 上报告通过降低布局漂移改善角色与环境一致性。

VQQA 动态生成针对具体提示的视觉问题,把视觉语言模型的批评当作语义梯度,通过自然语言接口迭代精修文本提示,并用全局选择机制在整条优化轨迹上按原始未编辑提示评分挑选最优候选。 相较通常计算昂贵或需要白盒访问模型内部信息的测试时优化方法,VQQA 以黑盒提示优化器方式工作,不直接改像素,而是修正属性绑定错误、角色属性不一致等高层构图缺陷。 文中给出两个示例:把真实感迈拉气球材质渲染到严格长方体几何上,以及让小提琴手与钢琴手在跨镜头时始终对应各自乐器;并在 T2V-CompBench、VBench2、VBench-I2V 上报告绝对质量增益。

启示与展望

该工作面向需要多镜头、分钟级乃至十分钟级连贯叙事的视频创作场景,适用对象是希望以高层创意规格驱动生成、而不愿手工维护逐镜头一致性的创作者与制作流程;其定位是编排层,可架设在任意基础生成模型之上,并原生继承 SynthID 水印等安全机制,生产环境还可对最终视频叠加额外安全分类器以防范单条安全片段之间的意外上下文交互。作者表示下一步将探索如何整合人在回路的工作流,目标是让创作者保持对创意方向与叙事设计的控制。

文中报告的是峰值分数与增益方向,未给出各基准的完整数值表、样本规模或统计细节,因此增益幅度与稳定性仍需查阅各篇单独论文确认;对比图例与十分钟长视频演示以定性展示为主,读者可能想进一步了解在不同题材、不同基础模型以及更长时长下的表现;此外,人在回路工作流尚在探索阶段,其与现有自动化编排的配合方式仍是开放问题。

来源