跳到主要内容
返回时间线
arXiv来源发表:

BPO 用反事实视图行为包替代单响应奖励,使 Qwen2.5-VL-7B 时序硬子集准确率提升 7.8 个百分点

相关研究与后续进展

核心概要

该工作提出行为包优化(BPO),把视频多模态大模型后训练中的单响应奖励替换为按问题类型选取的反事实视图上的输出行为包并联合打分,要求无关干预下稳定、关键证据移除时敏感、无证据时弃答,并以原始视图响应作为锚点相对优势;在 TempCompass、MVBench、NExT-QA 上,BPO 使 Qwen2.5-VL-7B-Instruct 的宏平均准确率较同 SFT 检查点、预算匹配的 vanilla GRPO 基线提升 4.7 个百分点,时序硬子集提升 7.8 个百分点,弃答 F1 提升 20.0 个百分点,并迁移到 Video-MME、LongVideoBench 与 LLaVA-Video-7B。

Source-provided article image: Behavior Pack Optimization for Video MLLM Post-Training
Figure 2 ·

Figure 2: Overview of Behavior Pack Optimization. Stage A installs the structured EST interface with SFT. Stage B routes each question to a question-typed view set, forms a behavior pack across counterfactual views, scores view-specific and cross-view contract rewards, and updates the policy with anchor-relative advantages.

arXiv

深度剖析

论文指出视频 MLLM 在视频问答基准上持续攀升,但打乱帧序、遮蔽支撑答案的片段或遮挡目标物体几乎不改变其预测,说明准确率依赖外观与语言先验而非问题所问的时序证据。 把这一现象归因于后训练的单位:奖励只在原始片段的单一响应上计算,模型从未被要求在不同视图间保持一致行为。 该诊断以三类反事实干预(帧序打乱、证据片段遮蔽、目标遮挡)下预测几乎不变为表述依据,属于摘要层面的现象陈述。

提出行为包优化(BPO),用按问题类型选择的反事实视图上的输出行为包替代单一响应并联合打分,包奖励同时要求无关干预时稳定、关键证据被移除时敏感、无证据时弃答。 将后训练目标从单响应正确性转为跨视图的行为一致性,并把弃答纳入奖励结构。 方法描述来自摘要,未给出视图集合的具体构造细节或奖励函数形式。

为在小包规模下保持目标稳定,BPO 采用锚点相对优势:以原始视图上的响应作为每个提示的参考,而非混合视图上的组均值。 用逐提示的原始视图锚点替代 GRPO 式组均值基线,以适配包内视图混合带来的方差。 摘要给出该设计动机与机制,未报告包规模取值或方差分析。

在 TempCompass、MVBench、NExT-QA 上,BPO 使 Qwen2.5-VL-7B-Instruct 的宏平均准确率提升 4.7 个百分点、时序硬子集提升 7.8 个百分点、弃答 F1 提升 20.0 个百分点,对照为同 SFT 检查点、预算匹配的 vanilla GRPO 基线;增益迁移到 Video-MME、LongVideoBench 及 LLaVA-Video-7B,消融表明增益随视图集合而非 rollout 数量变化。 在预算匹配与同起点条件下给出多基准、跨模型、含消融的对照结果,把增益归因于视图集合设计。 摘要报告了具体百分点差值、三个评测基准、两个迁移基准与一个额外模型,并以消融区分视图集合与 rollout 数量的贡献。

启示与展望

该工作面向视频多模态大模型的后训练阶段,适用于需要模型依据时序证据作答、并在证据缺失时弃答的视频问答场景;其收益在 Qwen2.5-VL-7B-Instruct 与 LLaVA-Video-7B 上、在 TempCompass、MVBench、NExT-QA 及迁移基准 Video-MME、LongVideoBench 上被报告。方法依赖按问题类型选择的反事实视图集合,因此适用前提是能够针对问题类型构造相应干预视图。摘要将包级视角定位为面向视频 MLLM 与多模态后训练社区的起点,供后续在证据落地视频推理方向上继续推进。

摘要未给出视图集合的具体构造方式、包规模取值、奖励函数形式与训练成本,也未报告各基准的分项结果与统计不确定性;消融以“增益随视图集合而非 rollout 数量”表述,其具体对照设置需在正文确认。此外,弃答 F1 提升 20.0 个百分点幅度较大,其评测口径与负样本构成值得在正文核对。这些属于方法复现与结果解读时需要留意的开放问题。

来源