跳到主要内容
返回时间线
arXiv来源发表:

ThinkV2V 让 MLLM 先思考再剪辑:5B 模型在复杂与标准视频编辑基准上均取得最佳总分

核心概要

该工作提出 ThinkV2V,一个在视觉生成前显式激活多模态大模型思考的推理驱动视频编辑框架:它用 Qwen3-VL-Thinking-8B 对源视频与指令做思维链推理并输出精炼提示,经可学习查询连接器把隐藏状态注入 Wan-2.1-5B 的 DiT,配合渐进式课程训练与推理时思考扩展,并构建 ThinkV2V-150K 数据集与 ThinkV2V-Bench 基准;在两种评判模型下,该 5B 规模模型在复杂与标准编辑场景中均取得最佳总分,并超过若干 10B 级基线。

AI-generated editorial illustration: ThinkV2V: Unleashing the Reasoning Capability of MLLMs for Instruction-Guided Video Editing

深度剖析

ThinkV2V 把 MLLM 从“语义编码器”改为“显式推理器”:MLLM 先对源视频与原始指令做思维链推理,产出精炼提示,并抽取 </think> 之后答案 token 的最后一层隐藏状态作为高层语义特征。 以往指令引导视频编辑方法主要把 MLLM 当作更强的语义编码器来联合处理提示与视频,而该工作让思考过程显式发生并转化为编辑条件。 消融显示,把 MLLM 当作静态编码器的“w/o Thinking”总体分为 2.51,启用思考并注入全部特征升至 2.63,改用答案特征进一步升至 2.68;定性对比也显示启用思考后编辑更贴合意图。

架构上采用 MLLM-to-DiT 设计:可学习查询连接器把 MLLM 隐藏状态压缩为固定长度条件特征,同时把原始指令文本嵌入与源视频 VAE 特征一并送入 DiT,以缓解信息瓶颈。 相比直接把长而不稳定的 token 序列暴露给 DiT,可学习查询做特征压缩与跨模块对齐;多条件设计避免过度依赖压缩后的 MLLM 特征,保留细粒度内容细节。 实现细节给出查询 token 长度为 512、连接器末层零初始化以稳定早期训练,DiT 由 Lucy-Edit 初始化,MLLM 在训练中保持冻结。

训练与推理配方由渐进式课程训练和推理时思考扩展组成:课程沿分辨率与指令复杂度两个轴分三阶段推进,推理时先串行精炼候选提示,再由 MLLM 做 best-of-N 选择。 该工作把“如何学推理”和“如何在测试时用推理”作为独立环节设计,而非仅依赖单次前向。 消融中“Simple-to-Complex”总体分 2.68,高于“Complex Only”2.10、“Complex-to-Simple”2.41、“Mixed Simple+Complex”2.47 与“Simple Only”2.52;仅串行精炼为 2.67,加入选择后升至 2.72。

数据与评测层面构建 ThinkV2V-150K 与 ThinkV2V-Bench:前者从 OpenVE-3M 保留五类编辑、经质量与适配性筛选后用 Gemini-2.5-Pro 重写为推理导向指令,后者把 OpenVE-Bench 的直白指令改写为推理导向指令,共 308 个视频-指令对。 现有数据集与基准主要强调基础编辑能力,缺少对隐式意图与因果推理的训练与评测支撑。 数据构建流程包含 Gemini-2.5-Flash 重打分、帧间 CLIP 相似度与时间闪烁度筛选,保留前 50% 高质量样本形成 OpenVE-HQ-1M,再每类选 2 万至 4 万样本合成 15 万视频对。

启示与展望

该结果面向需要隐式意图理解与因果推理的指令引导视频编辑,适用于五类编辑:全局风格、背景更换、局部移除、局部添加与局部更改;训练与评测均围绕这一范围设计。对希望减少复杂编辑中反复试错的创作者与内容生产流程,它提供了一条“先推理、再生成”的可复用路径;对研究者,ThinkV2V-150K 与 ThinkV2V-Bench 提供了可继续扩展的数据与评测基础。

作者在局限部分指出:显式思考带来额外计算与延迟,增加训练与推理开销;由于缺乏对语义推理轨迹的严格量化评测协议,思考内容本身的正确性未被独立评估;ThinkV2V-150K 与 ThinkV2V-Bench 对更开放域、更长时序与更稀有的复杂编辑场景覆盖仍有限。此外,基准规模为 308 个视频-指令对,属于刻意聚焦而非追求规模,其结论在更广泛编辑类型上的外推仍需后续验证。

来源