跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

arXiv

Foresight 让冻结的 Qwen3-VL-8B 在流式视频中自行规划未来感知,OmniPro Online 联合 F1 达 23.0,超过最强训练基线 9.5%

作者提出 Foresight:一种免训练的双流架构,用两个共享权重、输入编码器与 KV 缓存的 Siamese LLM,让一个副本持续摄取视频流、另一个副本提前读取同一因果状态并生成计划,决定何时再推理、届时检查什么、以及其间采样多密;在冻结的 Qwen3-VL-8B 上,OmniPro Online 平均联合 F1 达 23.0(最强训练基线 MiniCPM-o 4.5 为 13.5),StreamingBench 提升骨干 6.7 分并取得最优总体成绩,OVO-Bench 提升 15.4 分,其中证据在视频后段才出现的 Forward Active Responding 提升最大,为 18.7 分。