arXiv 2026年10月2日OneStreamer 提出一个 4B 流式视频大模型,通过共享的主动生成过程把与查询无关的证据记录和任务回应联合学习:Proactive Hierarchical Caption Memory 生成带时间锚定的局部细节描述与已完成事件摘要,Proactive State Transition Learning 在保留全部输出锚点监督的同时只监督 27.5% 的状态 token,配合流式数据合成管线构建了超过一百万条记录的 OneStreamer-1M,在八个流式视频理解基准上取得对比方法中的最佳结果。OneStreamer 提出一个 4B 流式视频大模型,通过共享的主动生成过程把与查询无关的证据记录和任务回应联合学习:Proactive Hierarchical Caption Memory 生成带时间锚定的局部细节描述与已完成事件摘要,Proactive State Transition Learning 在保留全部输出锚点监督的同时只监督 27.5% 的状态 token,配合流式数据合成管线构建了超过一百万条记录的 OneStreamer-1M,在八个流式视频理解基准上取得对比方法中的最佳结果。OneStreamer 用主动生成把流式视频的感知、记忆与及时回应统一到一个 4B 模型,在八个基准上取得对比方法中的最佳成绩OneStreamer 提出一个 4B 流式视频大模型,通过共享的主动生成过程把与查询无关的证据记录和任务回应联合学习:Proactive Hierarchical Caption Memory 生成带时间锚定的局部细节描述与已完成事件摘要,Proactive State Transition Learning 在保留全部输出锚点监督的同时只监督 27.5% 的状态 token,配合流式数据合成管线构建了超过一百万条记录的 OneStreamer-1M,在八个流式视频理解基准上取得对比方法中的最佳结果。OneStreamer 提出一个 4B 流式视频大模型,通过共享的主动生成过程把与查询无关的证据记录和任务回应联合学习:Proactive Hierarchical Caption Memory 生成带时间锚定的局部细节描述与已完成事件摘要,Proactive State Transition Learning 在保留全部输出锚点监督的同时只监督 27.5% 的状态 token,配合流式数据合成管线构建了超过一百万条记录的 OneStreamer-1M,在八个流式视频理解基准上取得对比方法中的最佳结果。
arXiv 2026年10月1日OneStreamer 通过共享的主动生成过程联合学习与查询无关的证据记录和任务响应:其 Proactive Hierarchical Caption Memory 生成带时间定位的局部细节描述与已完成事件摘要,Proactive State Transition Learning 在仅监督 27.5% 标注状态 token 的情况下优于密集状态监督,配合流式数据合成流程构建了超过一百万条记录的 OneStreamer-1M 数据集,4B 模型在全部八个评测的流式视频理解基准上取得对比方法中的最佳结果,消融显示保留生成描述可提升历史问答且不损害实时感知。OneStreamer 通过共享的主动生成过程联合学习与查询无关的证据记录和任务响应:其 Proactive Hierarchical Caption Memory 生成带时间定位的局部细节描述与已完成事件摘要,Proactive State Transition Learning 在仅监督 27.5% 标注状态 token 的情况下优于密集状态监督,配合流式数据合成流程构建了超过一百万条记录的 OneStreamer-1M 数据集,4B 模型在全部八个评测的流式视频理解基准上取得对比方法中的最佳结果,消融显示保留生成描述可提升历史问答且不损害实时感知。OneStreamer 用共享主动生成接口统一流式视频的感知、记忆与及时响应,4B 模型在八个流式视频理解基准上取得对比方法中的最佳结果OneStreamer 通过共享的主动生成过程联合学习与查询无关的证据记录和任务响应:其 Proactive Hierarchical Caption Memory 生成带时间定位的局部细节描述与已完成事件摘要,Proactive State Transition Learning 在仅监督 27.5% 标注状态 token 的情况下优于密集状态监督,配合流式数据合成流程构建了超过一百万条记录的 OneStreamer-1M 数据集,4B 模型在全部八个评测的流式视频理解基准上取得对比方法中的最佳结果,消融显示保留生成描述可提升历史问答且不损害实时感知。OneStreamer 通过共享的主动生成过程联合学习与查询无关的证据记录和任务响应:其 Proactive Hierarchical Caption Memory 生成带时间定位的局部细节描述与已完成事件摘要,Proactive State Transition Learning 在仅监督 27.5% 标注状态 token 的情况下优于密集状态监督,配合流式数据合成流程构建了超过一百万条记录的 OneStreamer-1M 数据集,4B 模型在全部八个评测的流式视频理解基准上取得对比方法中的最佳结果,消融显示保留生成描述可提升历史问答且不损害实时感知。