跳到主要内容
返回时间线
arXiv来源发表:

Foresight 让冻结的 Qwen3-VL-8B 在流式视频中自行规划未来感知,OmniPro Online 联合 F1 达 23.0,超过最强训练基线 9.5%

相关研究与后续进展

核心概要

作者提出 Foresight:一种免训练的双流架构,用两个共享权重、输入编码器与 KV 缓存的 Siamese LLM,让一个副本持续摄取视频流、另一个副本提前读取同一因果状态并生成计划,决定何时再推理、届时检查什么、以及其间采样多密;在冻结的 Qwen3-VL-8B 上,OmniPro Online 平均联合 F1 达 23.0(最强训练基线 MiniCPM-o 4.5 为 13.5),StreamingBench 提升骨干 6.7 分并取得最优总体成绩,OVO-Bench 提升 15.4 分,其中证据在视频后段才出现的 Forward Active Responding 提升最大,为 18.7 分。

AI-generated editorial illustration: Foresight: planning future perception in streaming VLMs without retraining

深度剖析

论文把“预期”从预测目标改造成控制计算的手段:模型在每一步判断场景中还缺什么、决定何时再看、并设定此前的采样密度,使流式推理成为闭环而非固定计算序列。 此前的主动流式方法(如 StreamAgent)虽把预测反馈进计算,但规划按固定日程运行;Foresight 由 VLM 自身生成一份计划,同时携带下一次推理的时机、待解决的问题与采样密度。 以冻结 Qwen3-VL-8B 为骨干,在 OmniPro Online、StreamingBench、OVO-Bench 三个流式基准上评测;附录 F 用提前量实验显示事件前 2 秒模型可弥合约四分之三的盲基线到 oracle 的差距,30 秒时降至约十分之一。

双流 Siamese 架构让规划与感知并发:Ingest 副本是共享 KV 缓存的唯一写入者,Think 副本只读快照并写计划,因此规划不阻塞摄取。 其他异步系统常用不同 LLM 或编码器,需重复视频编码与处理;Foresight 用共享 KV 缓存的异步孪生 VLM,把瞬时证据状态与持久控制更新分离。 算法 1 给出并发的感知循环与规划循环;消融显示忽略全部计划字段时联合 F1 从 23.0 降至 0.7,去掉 Answer 字段降至 0.3,说明控制接口本身承担主要作用。

在线重配置以低开销实现:计划只解码需要推理的字段,布尔决策通过 yes/no 词元对数比探针读取,后续步骤只解码相对当前计划的 diff,并由 Live Executor 应用到输入门、编码器与缓存。 相比每次检查重建上下文的控制器,共享 KV 缓存使每个视觉词元只预填充一次,diff 与探针把每次检查的成本压到常数级少量词元。 附录 G 的成本模型给出各设计选择的量级差异(如去掉共享 KV 缓存约使总算力上升一个量级),并说明这些因子来自模型而非实测;实测中 QueryStream 的实时因子为 0.053–0.084,StreamAgent 为 2.13–2.70。

该推理时控制器在主动响应与通用流式理解上均带来提升,且在证据后到时收益最大。 Foresight 在 OmniPro Online 上平均联合 F1 23.0,高于最强训练基线 MiniCPM-o 4.5 的 13.5;在 StreamingBench 上总体 66.00 为最优,在 OVO-Bench 上总体 62.16,Forward Active Responding 提升 18.7 分。 所有 Foresight 结果在按基准随机划分的 80% 留出集上计算,阈值仅在 20% 校准集上拟合;StreamingBench 的 Proactive Output 被作者视为诊断性指标,因其置信区间较宽。

启示与展望

该结果面向需要主动、异步响应的流式视频理解场景,例如实时人机交互中系统需在未被显式提示时对事件作出响应。方法以冻结的 Qwen3-VL-8B 为骨干,采用 Qwen3-VL 原生视频输入管线,把连续准入帧按两帧一组作为视频输入;由于骨干只接受视频,OmniPro 评测使用不需要音频的子集。控制器不更新任何权重,因此同一套机制可直接迁移到更强的骨干。计划字段以持久控制状态保存,未显式更改的字段沿用旧值,使帧率与待解决问题在后续步骤中保持有效。

预期的可靠性受限于底层 VLM 的能力:作者指出 Foresight 的预期与时间事件定位精度取决于骨干模型,可靠运行需要具备强未来预期与时间定位能力的 VLM。首次误触发后模型偶尔会继续报告后续观察并不支持的事件,向 Think LLM 提供已观察与已报告的历史可显著减少但未消除该行为。控制器对提示措辞仍然敏感。附录 F 表明当前 VLM 的预期在数秒内衰减,因此控制器必须在无事发生的时刻也进行检查,达到“每个事件一次检查”的理想速率需要预期持续更久的模型。附录 G 的成本曲线使用代表性词元数与假设的检查率分布,作者指出实测的基准检查率可替换这些假设。StreamingBench 的 Proactive Output 任务问题数少、置信区间宽,作者将其视为诊断而非头条结果。本总结依据的是论文全文文本,未包含图表与附录中的逐项数值细节。

来源