CoEvoWhen让冻结VLM在超长视频中自我进化策略与工具,ExtremeWhenBench的mIoU提升74.9%同时视觉token下降11.4%
核心概要
CoEvoWhen提出策略—工具协同进化框架,从VLM的智能体推理轨迹中联合进化高层策略与可执行媒体工具,形成不更新模型参数的可复用技能,在五个基准和三个VLM上提升超长视频时序定位精度并降低推理视觉token开销,且该技能无需额外任务特定进化即可迁移到通用长视频问答。
深度剖析
框架把高层策略与可执行媒体工具共同表示为一个外部技能,从VLM执行轨迹与真值区间构成的反馈中迭代改进,全程冻结VLM参数。 既有智能体方法多依赖预定义的策略与工具能力,而该工作让工具实现本身也进入进化循环,从最小基础技能出发,由外部技能更新器蒸馏可迁移经验并编写代码升级或新建工具。 论文给出形式化的问题设定与技能更新过程,并说明进化在100条查询上单次遍历、每四条查询形成一次反馈批次,VLM权重保持不变。
进化后的技能让冻结VLM自主编排图像与视频观测,在三个超长视频时序定位基准上取得一致提升。 相对基础技能,VUE-LVTR留出集IoU AUC从0.4107升至0.5137,ExtremeWhenBench的mIoU与Recall@0.5分别提升74.9%和88.4%,CoMET-Bench的mIoU提升0.0280、Rejection-F1提升10.93点。 结果来自三个基准的官方指标,ExtremeWhenBench使用全部2273条官方测试查询,CoMET-Bench保留1599条视频至少30分钟的查询,VUE-LVTR评估使用与进化集不相交的307条查询。
精度提升伴随推理视觉开销下降,并出现视觉预算在图像与视频观测之间的重新分配。 VUE-LVTR留出集平均每查询视觉token从202.6k降至141.9k,ExtremeWhenBench下降11.4%,CoMET-Bench下降18.9%;在ExtremeWhenBench上图像token从179.3k升至197.5k,视频token从47.8k降至3.7k。 token成本按每次请求实际送入VLM的图像与视频token累计并跨查询平均,模型调用与本地工具调用次数也同步下降。
进化技能可跨VLM与跨任务迁移:在不同骨干上分别进化均获提升,直接用于长视频问答也提高准确率。 ExtremeWhenBench上Qwen3.5-9B与Qwen3.6-27B的mIoU分别提升99.2%与24.7%;把为定位进化的技能直接用于LVBench与LSDBench,Qwen3.5-27B总体准确率分别提升8.65与7.98点,且未做任务特定进化。 跨VLM结果来自三个模型各自进化的技能对比,跨任务结果来自冻结技能直接迁移,消融显示联合进化优于仅进化策略或仅进化工具。
启示与展望
该结果面向超长视频(数十分钟至数小时)的时序定位与长视频问答场景,适用于以冻结VLM为主智能体、通过工具主动获取视觉证据的设定。进化在来自单一数据源的100条带标注查询上完成,评估覆盖VUE-LVTR、ExtremeWhenBench、CoMET-Bench三个定位基准与LVBench、LSDBench两个问答基准。对使用者而言,可直接复用的是进化后的技能(策略文档与可调用工具),而非模型权重;跨VLM使用时需在对应骨干上分别进化。
进化目前依赖带标注反馈且限于单一数据源,更大规模、更多数据来源以及无标注反馈下的进化仍是开放问题。当前所有视觉观测都由作为主智能体的VLM直接完成,何时应由主智能体直接观测、何时委托子智能体观测及其协调方式尚未展开。框架目前只处理视觉模态,向全模态扩展有待研究。此外,CoMET-Bench上事件数较多的查询F1@0.5仍偏低,多事件精确定位仍是难点;Qwen3.6-27B在Environment类别与8–15事件分组上出现小幅下降,说明进化收益的分布依赖模型与查询类型。
