跳到主要内容
返回时间线
arXiv来源发表:

APM-Bench 用 549 段会话、104 条生活轨迹测试流式视频助手的跨会话持久记忆,发现现有方法难以同时兼顾召回、延迟与存储

核心概要

该工作提出 APM-Bench,把第一视角流式交互重构为多会话生活轨迹(549 段会话、104 条轨迹、2,719 个候选问题,平均每条轨迹 69 分钟视频),在跨会话理解、实时感知与自适应响应三类能力上评测通用视频模型与八种专用记忆系统,并设置证据可用性感知测试,结果显示存在明显的效用—延迟—存储权衡:原始视频记忆跨会话表现最强但需 GiB 级存储与高延迟,文本摘要把存储降到 KiB 级却损失跨会话性能,事件结构化记忆在专用系统中效用最好,而自适应响应即使给出丰富历史仍然困难。

AI-generated editorial illustration: APM-Bench: Benchmarking Cross-session Persistent Memory for Egocentric Streaming Video Assistants

深度剖析

APM-Bench 把真实世界的第一视角流式交互重构为多会话生活轨迹,会话之间保留真实时间间隔,从而把"记忆能否跨中断持久保留"变成可测量的评测对象。 此前流式视频基准多聚焦单段连续视频或短片段,APM-Bench 用 549 段会话、104 条轨迹、2,719 个候选问题覆盖跨会话理解、实时感知与自适应响应三类能力共 12 项任务,并保留会话内连续时序与会话间真实间隔。 基准构建基于 EgoLife 与 HD-EPIC 两个第一视角数据集,经两阶段流水线生成候选并做自动与人工复核;在 300 个抽样问题上两名标注者达到 Cohen's kappa 一致性,每条轨迹平均 69 分钟视频、单会话平均 13 分钟。

评测显示记忆表示存在清晰的效用—延迟—存储权衡:原始视频记忆跨会话理解最强,文本摘要把存储压到 KiB 级但损失跨会话性能,事件结构化记忆在专用系统中效用最好。 以往评测很少把记忆效用与部署成本放在同一框架下比较,APM-Bench 通过会话切分自然定义了记忆存储边界,使不同记忆表示可在同一轨迹上比较效用、存储与首 token 延迟。 在统一 1 FPS 输入与相同主机配置下评测通用视频模型与八种专用系统;原始视频记忆达到 GiB 级存储与较高查询开销,文本摘要为 KiB 级,专用系统中事件结构化方法效用最强,参数化记忆状态不随视频长度增长但效用有限且延迟不低。

过多的历史信息会干扰当前场景理解,持久记忆需要被选择性注入,而不是越多越好。 这一发现把"存什么"与"何时用"区分开来:对多数通用视频模型,用文本摘要替换原始视频历史反而提升了实时感知表现,说明对后续召回有用的信息在当前交互中可能是不必要的甚至分散注意力的。 实时感知任务基于当前会话内的因果视频前缀评测,对比同一模型在原始视频记忆与文本摘要记忆两种条件下的表现;附录中 FluxMem 的实时感知分数随所提供视频增长而从 Oracle 条件的 33.95 降至 APM-Bench 的 25.14 与 Raw Lifelong 的 15.28。

强召回能力并不等于能识别证据缺失,自适应响应即使给出丰富历史也仍然困难。 APM-Bench 专门构建了证据可用性感知评测集,并区分显式注册驱动的协助(RCR、PRM)与完全自主的主动协助(MPA、TPG),从而把"何时该说话"与"说得对不对"分开考察。 证据可用性感知集包含 260 个跨会话理解问题,模型只能访问最近两个已完成会话,其中 130 题证据在可及历史内、130 题需要历史外证据;Gemini 3.6 Flash 在证据可及时表现强(85.38%)但识别证据不可用较弱(59.23%),SimpleStream 呈相反模式;在自适应响应上,即使使用原始视频记忆,最强通用模型在 MPA 与 TPG 上仍明显弱于 RCR 与 PRM。

启示与展望

该基准面向第一视角流式视频助手场景,适用于需要在会话中断后复用过往视觉经验、同时受存储与响应延迟约束的系统;其轨迹来自 EgoLife 与 HD-EPIC,覆盖日常活动与结构化厨房流程,因此结论最直接适用于可穿戴或移动式个人助手。对希望比较记忆表示(原始视频、文本摘要、KV 缓存、视觉 token、事件树、参数化记忆、推理轨迹)的研究者,APM-Bench 提供了在同一轨迹上同时观察效用、存储与首 token 延迟的测试台;证据可用性感知集则为"何时应承认证据不足"提供了可测量的目标。

评测在统一 1 FPS 输入与相同主机配置下进行,专用系统的存储按推理期间维护的记忆状态估计,因为多数方法面向单段连续视频、不导出持久状态;这一估计方式对结论的影响值得关注。证据可用性感知集只允许访问最近两个已完成会话,其结论在更长可及历史下是否成立仍是开放问题。自适应响应的开放式回答由 LLM 作为评判者打分,评判标准与人工判断之间的一致性有待进一步观察。此外,轨迹组织方式与更长的原始历史之间的对比仅在 12 条 EgoLife 轨迹、366 个候选上进行,样本规模有限。

来源