OneStreamer 用主动生成把流式视频的感知、记忆与及时回应统一到一个 4B 模型,在八个基准上取得对比方法中的最佳成绩
核心概要
OneStreamer 提出一个 4B 流式视频大模型,通过共享的主动生成过程把与查询无关的证据记录和任务回应联合学习:Proactive Hierarchical Caption Memory 生成带时间锚定的局部细节描述与已完成事件摘要,Proactive State Transition Learning 在保留全部输出锚点监督的同时只监督 27.5% 的状态 token,配合流式数据合成管线构建了超过一百万条记录的 OneStreamer-1M,在八个流式视频理解基准上取得对比方法中的最佳结果。
深度剖析
PHCM 把观察到的内容转成两类带时间对齐的文本记录:</Observe> 生成密集的局部细节描述,</Summary> 生成较稀疏的已完成事件语义摘要,二者在推理时与 Recent-FIFO 视觉窗口互补,提供远距离事实上下文而无需重新检索或回看历史视觉特征。 以往的记忆机制要么压缩或检索远距离视觉证据、让历史视觉 token 与近期观察争夺有限上下文,要么只用严格近期窗口而丢弃远距离事件;这里把与查询无关的记忆写入与后续任务条件下的使用分开,用紧凑文本承载过去事件。 消融显示,在相同 checkpoint 与 Recent-16 窗口下,保留生成描述使 OVOBench-Backward 的 ASI 从 63.5 提升到 71.6、EPM 从 62.0 到 62.6;PHCM 同时把 OVOBench Real-Time 从 80.9 提到 81.4、StreamingBench Real-Time 从 86.3 提到 86.9,并在 ASI 上以 71.6 超过 Full 的 67.6,EPM 略低于 Full 的 63.0(62.6)。
PSTL 通过保留所有输出锚点的监督、并按配额对频繁转移组做无放回均匀子采样,选出具有代表性的状态变化与状态持续 token,从而缓解重复等待状态对状态目标的支配。 密集状态监督会因重复的静默 token 远多于触发输出的 token 而过度强调等待,而只监督状态变化又缺少对状态持续的监督;PSTL 同时覆盖两类位置,且未选中的状态 token 仍留在因果序列中、只是不计入状态损失。 在相同训练数据、输入序列与文本监督下,PSTL 只监督 27.5% 的标注状态 token,却在三个基准上取得最佳:ProactiveVQA 48.7、OmniMMI 36.6、OVO-Timing 41.6;相同监督比例下的随机稀疏基线仅为 26.6、27.4、1.4,说明增益并非仅来自稀疏性。
研究团队构建了可复用的流式数据合成管线,把离线视频资源转成流式训练序列:描述分支让局部描述只在其支撑区间被观察后释放、片段摘要只在事件完成后释放;QA 分支先定位粗粒度证据区间并验证其可回答性,再以滑动窗口做细粒度响应时间校准。 已有流式 QA 数据常存在响应时间监督标定不佳的问题,有的目标被安排在证据尚不充分之前,有的被安排在证据早已充分的区间末尾;这里把证据定位与响应时间校准分开处理。 校准平均把响应时间相对原始标注或证据区间末尾提前 13.72 秒,86.62% 的记录获得更早的响应时间;与清洗后的开源数据结合形成 OneStreamer-1M,列出记录合计 1,160,004 条,并按源视频级别对每个评测基准的测试集做去污染。
4B 的 OneStreamer 在八个流式视频理解基准上取得对比方法中的最佳成绩,覆盖感知与记忆以及主动回应两类任务。 相比同规模的 Qwen3-VL 基座和 11B 的 MOSS-VL-Realtime,它在实时感知、长程在线理解与主动回应上都取得提升,说明主动生成可以作为连接感知、记忆形成与及时回应的共享学习接口。 感知与记忆四项为 OVOBench 72.1、StreamingBench Real-Time 86.9、OVBench 66.8、ODVBench 71.3,比同规模 Qwen3-VL 基座分别高 13.3、5.1、11.4、13.7 分;主动回应四项为 ProactiveVQA 48.7、OmniMMI 36.6、OVO-Timing 41.6、ViSpeak 2.87,前三项比基座高 14.4、7.2、12.2 分。
启示与展望
这项工作面向需要在开放视频流中持续观察、并在证据充分时及时回应的场景,例如直播助手、可穿戴代理与安防监控;其结论适用于以 Qwen3-VL-4B-Instruct 为初始化、在 OneStreamer-1M 与部分离线数据上做单阶段监督微调、冻结视觉编码器并训练投影器与 LLM 的设定。PHCM 的收益在 Recent-16 视觉窗口与 128 帧、4 fps 的层级描述记忆配置下测得,效率数据来自 360 秒样本与单张 H200 的在线吞吐测试。数据合成管线依赖 Gemini 与 Seed 系列模型生成多粒度标注与问答,并用 Qwen 系列模型做证据区间验证与响应时间校准,因此其可复现性依托这些外部模型。
论文自述的失败案例显示,模型在解释物体状态变化时可能出错,且在后续帧已明确显示状态的情况下没有修正先前的描述,这提示状态变化理解与错误更正仍是开放问题。响应时间校准被作者描述为不总能定位最早可回答时刻,而是在及时性与证据充分性之间取折中。消融中 PHCM 的 EPM 略低于保留完整视觉历史的 Full 配置,说明两类表示在不同指标上各有侧重。此外,本次读取的文本包含正文、附录与逐基准结果表,但未包含图 3、图 5 至图 12 的图像内容,因此对架构示意与定性案例的理解依赖正文文字描述。
