跳到主要内容
返回时间线
arXiv来源发表:

VideoLoop 用双循环有界工作记忆缓解长视频智能体的语义抖动,在 VideoMME(长)等三项基准上把 Gemini 3.1 Pro 提升 3.2 至 4.5 个百分点

核心概要

该工作把长视频智能体的失败模式形式化为“语义抖动”——只追加的工作记忆会不断累积噪声、稀释关键证据,并提出 VideoLoop:外层多模态智能体在沙箱文件系统中探索视频,内层记忆编排器在每一步之后从无界文件系统检索相关产物并重写有界工作记忆;在 VideoMME(长)、VideoMMMU 与 LongVideoBench(长)上,VideoLoop 以即插即用方式提升四个 LVLM 主干,平均在 VideoMME(长)上比基线高 4.2 个百分点,使用 Gemini 3.1 Pro 时分别达到 88.3%、88.8% 与 80.9%。

AI-generated editorial illustration: VideoLoop: Looped Working Memory Against Semantic Thrashing in Long-Form Video Agents

深度剖析

论文给出结构性论证:只追加的工作记忆可以纳入新观察到的目标证据,却无法删除已累积的无关证据,也无法阻止有序上下文持续增长,除非引入重写算子。 此前多数视频智能体采用单循环加只追加记忆的设计,把记忆退化当作调参问题;该工作把“语义抖动”类比操作系统抖动,用状态散度把记忆与最优证据集的差距分解为缺失目标证据与冗余噪声,说明这是只追加更新的结构性属性。 论证基于形式化推导(式 2 至式 4)与概念性诊断,作者明确称其为“概念性诊断而非定理式归约”;未做消融式证明,但为后续设计提供了动机。

VideoLoop 采用双循环解耦设计:外层循环用策略模型探索视频并把观察与中间分析写入持久文件系统,内层循环在每一步之后检索与问题相关的产物并重写有界工作记忆。 与依赖预定义流水线或预建索引的既有系统不同,VideoLoop 在编码沙箱中运行、自行编写代码指导探索,只用四个工具原语(Analyze、Transcribe、Execute、Answer),无需前置视频预处理或固定模式;与 VideoMem、WorldMM、MemGPT 等记忆机制相比,它把视频探索与工作记忆维护交给专门的内层智能体。 方法细节完整:工作记忆预算设为 32K token,关键帧最多 6 张,外层最多 50 次、最少 6 次推理迭代,记忆为六段式文档,文件系统分三层;重写收益由式 7、式 8 给出条件,作者注明这是“重写质量的条件,而非无条件保证”。

在三项长视频基准上,VideoLoop 以即插即用方式提升多个 LVLM 主干,并在最难问题上显著缓解记忆退化。 相对原生 Gemini 3.1 Pro,VideoMME(长)提升 4.5 点、VideoMMMU 提升 4.2 点、LongVideoBench(长)提升 3.2 点;相对最强既有智能体方法分别领先 7.1、10.4、4.5 点。消融显示只追加智能体为 81.9%,双循环重写为 83.3%,加入文件系统后达 85.8%。 评测覆盖 VideoMME(长)900 题、VideoMMMU 900 题(三条认知轨道各 300 题)、LongVideoBench(长)564 题;难度分层由 Claude Opus 4.8 排序并经人工复核。记忆质量用“盲判官”代理衡量:只读上下文快照、不看视频与工具,Q4 上 VideoLoop 为 81.1%、只追加为 60.9%。

记忆编排同时改善 token 效率与探索行为:文件系统把中间证据外置并按需复用,而非反复把完整历史带入上下文。 在 Gemini 3 Flash 下,只追加基线为 614.9K token/题、准确率 81.9%;仅双循环为 647.0K、83.3%;完整 VideoLoop 为 618.2K、85.8%,输入 token 从 584.6K 降至 559.0K。行为分析显示 VideoLoop 查看帧分布更集中于低成本区间、每题迭代更少、时间分布更均衡。 token 与准确率对照来自同一基准上的受控比较;行为分析基于查看帧分布与迭代次数的统计趋势,属于观察性证据。

启示与展望

该结果面向需要在长视频上做多步证据收集的多模态智能体场景,适用于可提供沙箱文件系统与工具调用的部署环境;方法以即插即用方式作用于已有 LVLM 主干,无需重训练,因此对希望在不改动模型权重的前提下提升长视频问答的团队最直接可用。作者把结论推广为长时程智能体的通用原则——“记忆应被策展,而非累积”,这为对话智能体、文档智能体等需要跨多步保留证据的系统提供了可迁移的设计思路。评测设定为 VideoMME(长)、VideoMMMU 与 LongVideoBench(长)三项基准,工作记忆预算 32K token、关键帧上限 6 张、外层迭代 6 至 50 次,这些配置界定了结果适用的范围。

重写收益由式 8 给出的是条件而非无条件保证,因此内层编排器的重写质量本身仍是关键变量;论文用盲判官只读上下文快照作为可检索性代理,这一代理与最终答题正确率之间的关系值得在更多任务上观察。难度分层由 Claude Opus 4.8 排序并经人工复核,换用其他分层方式时 Q1 至 Q4 的差距是否稳定尚待检验。token 效率结论来自 Gemini 3 Flash 上的单组对照,其他主干与更长视频下的开销结构仍属开放问题。此外,本次可读文本为论文全文与首页摘要,未包含图表原始数据,因此查看帧分布与迭代次数的具体数值只能依据正文描述。

来源