跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

arXiv

BPO 用反事实视图行为包替代单响应奖励,使 Qwen2.5-VL-7B 时序硬子集准确率提升 7.8 个百分点

该工作提出行为包优化(BPO),把视频多模态大模型后训练中的单响应奖励替换为按问题类型选取的反事实视图上的输出行为包并联合打分,要求无关干预下稳定、关键证据移除时敏感、无证据时弃答,并以原始视图响应作为锚点相对优势;在 TempCompass、MVBench、NExT-QA 上,BPO 使 Qwen2.5-VL-7B-Instruct 的宏平均准确率较同 SFT 检查点、预算匹配的 vanilla GRPO 基线提升 4.7 个百分点,时序硬子集提升 7.8 个百分点,弃答 F1 提升 20.0 个百分点,并迁移到 Video-MME、LongVideoBench 与 LLaVA-Video-7B。