跳到主要内容
返回时间线
arXiv来源发表:

GEB 用视觉身份把长视频观察串成实体传记,在 EgoLifeQA 上把准确率推到 72.0%,比最强已发表记忆框架高 4.4 个百分点

核心概要

该工作提出 Grounded Entity Biographies(GEB)长视频记忆框架,把跨片段中同一物理实例的视觉落地观察归组成可检索的“传记”,并在问答时把传记与情节证据一起检索;在四个基准(含日长与周长录像)上,多选与开放式问答均优于既有记忆框架,EgoLifeQA 达到 72.0% 准确率,比最强已发表结果高 4.4 个百分点,消融显示落地身份关联与传记阅读各自都有贡献,而仅增加描述无法完全复现这些增益。

AI-generated editorial illustration: Beyond the Timeline: Augmenting Long-Video Memory with Grounded Entity Biographies

深度剖析

GEB 把同一物理实例的观察组织成时间有序的“传记”,每条观察保留可见主体、事件上下文与来源证据,实体节点作为跨情节的桥梁。 既有记忆框架依赖时间描述与文本派生实体,同一描述可能对应不同物体、同一物体又可能因状态变化被拆成多个名字;GEB 改用视觉与上下文证据做跨片段关联,并用共享帧中的视觉分离来否决匹配。 论文给出形式化表示(实体、观察、情节、源片段四类节点与三类关系),并在 EgoLife 一周录像上构建记忆:6,266 个 30 秒片段、308,244 条被跟踪观察、关联后 77,716 个实体,其中 27,446 个含两条以上观察、15,365 个跨天。

检索通过身份传播:查询命中一条观察后,沿同实例边到达同一推断实例的其他观察,再沿上下文边到达其周边情节与源帧,传记摘录还列出尚未检索到的出现时间与次数,为控制器提供后续搜索目标。 以往检索式方法按语义相似度取回证据,取回相关事件并不等于恢复某个特定实体的“传记”;GEB 让身份在记忆构建阶段就建立,检索时可直接沿身份链接跨天追踪。 在 EgoLifeQA 上,证据命中率从 MAGIC-Video 的 37.6% 升至 58.9%;在 MultiHop-EgoQA 上,完整证据覆盖从 35.4% 升至 52.1%(相对提升 47%),需要多个区间的题目相对增益更大。

在控制器、答案模型与检索限额一致的前提下,GEB 在四个基准上超过既有记忆框架:EgoLifeQA 72.0%(+4.4 个百分点)、Ego-R1-Bench 71.3%(+6.6)、MM-Lifelong Test@Week 36.83%(+5.41)、Test@Day 17.58%(+0.83)。 这些比较与 MAGIC-Video 共享情节字幕、主题与事件摘要以及检索限额,因此增益来自记忆组织方式而非更多上下文;MultiHop-EgoQA 上把 MAGIC-Video 的每轮配额从 3 提到 6 后,其完整覆盖仍低于 GEB。 EgoLifeQA、Ego-R1-Bench 与 Test@Week 的 95% 置信区间不含 0;Test@Day 对最强基线 ReMA 的 0.83 点增益区间含 0,但对 MAGIC-Video 与 WorldMM 的区间分别为 [+3.34,+11.84] 与 [+4.83,+13.50]。

消融把增益拆到具体部件:去掉关联降 3.4 点、按名字做身份键降 2.8 点、把描述直接拼进字幕降 3.8 点;去掉同实例边降 3.0 点,断开观察与情节/源片段降 3.8 点,两者都去掉降 5.0 点;对两个模型都隐藏传记文本降 4.0 点,只对答案模型隐藏降 1.2 点,去掉未检索观察提示降 1.8 点。 这些对照说明物理实例组织与传记阅读带来的收益,不能由“更多描述”或单纯的图检索解释。 消融在 EgoLifeQA 上以固定控制器与答案模型进行,并在 MM-Lifelong 两个划分上复现同向结果(拼接描述在 Week/Day 分别损失 3.25 与 5.08 点)。

启示与展望

该结果面向需要跨事件追踪同一人物或物体的长录像问答场景,例如周长自我中心生活记录与长时间游戏直播;记忆离线构建一次即可服务后续所有提问,检索时按查询时间限制在之前的记录上,因此适合时间戳受限的问答设定。对使用者而言,可直接复用的是“观察—实体—情节—源片段”的记忆结构与沿身份传播的检索方式,以及把未检索到的出现时间作为后续搜索线索的控制器接口。

身份由视觉证据推断,长视频中的可靠跟踪与再识别仍是开放问题,关联错误可能把观察归入错误的传记,上下文描述也可能把附近动作归到错误实体;记忆图更大也带来比纯字幕检索更高的延迟(论文报告单次搜索平均 5.6 秒、每个问题约 13.6 秒)。保守关联可能让同一物理实例保留多个标识符,论文用同名传记的提示区分“有视觉分离证据”与“身份未定”两类。Test@Day 上对最强基线的增益置信区间包含 0,因此该划分上的优势仍需更多证据。此外,本次读取的文本中部分数值在正文处缺失(如 EgoLifeQA 证据命中率与部分准确率的原始数字在摘要与正文中未完整呈现),若需精确复现应回到原文表格核对。

来源