VideoGen-Agent 用多任务强化学习让视频生成智能体学会调用检索、仿真与验证工具,在 VABench 上把基础生成器从 56.5 提升到 75.6,换用更强生成工具后达到 86.1
核心概要
该工作提出 VideoGen-Agent,一个通过监督微调加多任务智能体强化学习训练的多模态智能体,在六类视频生成任务(程序性知识、单实体身份、多实体身份、物理仿真、组合场景、多镜头)中协调检索、仿真、生成与验证工具,并构建了 600 条提示的 VABench 基准;在 VABench 上把基础 T2V 生成器 Seedance 1.0 从 56.5 提升到 75.6,换用未在训练中见过的升级生成工具后进一步提升到 86.1,人类评分者在 100 对比较中更偏好该配置。
深度剖析
VideoGen-Agent 用一个共享多模态策略在六类视频生成任务中协调增强、生成与验证工具,通过推理—行动—观察循环按提示与中间观测选择工具。 以往智能体视频生成方法多针对单一目标,而该工作把工具选择与使用统一到一个策略中,覆盖程序性知识、单实体身份、多实体身份、物理仿真、组合场景与多镜头六类任务。 论文给出六类任务与默认工具子集的映射表,并说明每类任务的典型工作流,如程序性知识用文本检索加 T2V、物理仿真用代码加 M2V、多镜头用 T2V 加 ELF 加 I2V 逐段生成。
训练分两阶段:先在 16K 教师蒸馏轨迹上做监督微调,再用 GRPO 在剩余 8K 提示上做多任务智能体强化学习,奖励由格式奖励、VLM 奖励与工具使用奖励组成,并做任务级优势归一化。 该工作把智能体强化学习从问答与信息检索场景扩展到视频生成,奖励同时评估工具调用有效性与生成视频质量,并用任务级归一化平衡不同类别的学习信号。 论文给出混合奖励公式、组相对优势与任务级归一化公式、token 级 GRPO 目标,以及消融结果:去掉 VLM 奖励整体降到 73.3,去掉工具奖励降到 71.2,均低于完整配置的 75.6。
在 VABench 上,VideoGen-Agent 用 Toolset 1 达到 75.6,超过基础 T2V 生成器 Seedance 1.0 的 56.5 和最强单模型基线 Seedance 2.0 的 73.2;换用 Toolset 2 后达到 86.1,并在全部六类中取得最高分。 该工作引入 VABench 这一 600 条提示的留出基准,每类 100 条,并用类别特定的 VLM 评分标准评估;工具升级无需额外智能体训练即可带来提升,说明学到的工具使用与生成工具进步互补。 主结果表列出各基线在六类上的分数与总分;工具升级把多实体身份从 65.3 提升到 86.7,提升幅度最大;人类评分者在 100 对比较中更偏好 Toolset 2 配置。
消融显示提示改写与零样本工具使用只带来有限提升(57.3 与 59.5),SFT 提升到 69.2,RL 再提升到 75.6;单任务 RL 整体为 76.3,略高于多任务 RL 的 75.6,但多任务 RL 用单一智能体覆盖全部六类任务。 该工作把训练阶段、奖励成分与单任务/多任务设置的贡献分开量化,说明仅提供工具与提示不足以获得主要增益,轨迹监督与奖励优化才是关键。 消融表列出各变体在六类上的分数;论文指出零样本智能体尽管有工作流指引仍经常无法正确调用工具;单任务 RL 在程序性知识、多实体身份与组合场景上更高,多任务 RL 在其余类别上更高。
启示与展望
该结果面向需要外部知识与工具支撑的视频生成场景,适用于六类任务:程序性知识、单实体身份、多实体身份、物理仿真、组合场景与多镜头。对希望在不重新设计工作流的前提下升级生成工具的团队,论文显示同一训练好的策略可直接配合兼容的新生成工具使用,且论文通过继续训练把动作到视频管线接入机器人操作场景。评估以 VABench 的 600 条提示与类别特定 VLM 评分为主,并辅以 100 对视频的人类偏好比较。
论文自述当前受生成工具的质量与延迟、验证反馈的覆盖范围以及六任务训练设置的限制。物理仿真中 VLM 只评估接触、反弹、运动方向与诱导旋转等合理性,不从事外观判断精确质量、速度或加速度,定量检查由单独代码提供。多镜头任务在生成前会检查时长是否被工具支持并相应调整时间戳。奖励模型与人类偏好的一致性在程序性知识类别最低,论文指出专门程序性知识对评判模型仍是挑战。此外,加载文本中部分数值以占位形式出现,如主结果段落中的提升点数与人类偏好比例,因此这些具体数字无法在此总结中给出。
