跳到主要内容
返回时间线
arXiv来源发表:

MemLife用实体锚定的第一人称文本记忆加时间索引智能体读取器,在四个长时程第一视角视频基准上比最强免训练基线高出4.6–12.0%,MemOpt再以FIRM奖励只训练记忆写入器提升2.7–5.0%

核心概要

该工作提出MemLife——一个把第一视角视频压缩为时间与实体锚定的第一人称文本片段、并由时间索引的智能体读取器检索的多模态记忆系统,在无需训练、也无需查询时访问视频的条件下于四个长时程基准上比最强免训练基线提升4.6–12.0%;并进一步提出MemOpt,用忠实、信息量、可检索的FIRM奖励只对记忆写入器做强化学习,使MemLife再提升2.7–5.0%,且增益可跨写入器与读取器骨干、记忆系统以及域外视频与问题分布迁移。

AI-generated editorial illustration: MemLife: Curating and Reasoning over Long-Term Egocentric Video Memories

深度剖析

MemLife把每段30秒视频独立写成时间与实体锚定的第一人称文本片段,并用智能体读取器通过改写查询、时间区间检索与按时间顺序组织证据来作答。 以往的记忆系统要么压缩过度丢失证据,要么在增长的检索空间中因检索竞争而找不到相关条目;MemLife把写入与读取分开设计,写入不依赖问题,读取则结合语义搜索与时间范围抓取。 在SuperMemory-VQA、EgoLifeQA、SuperMemory-LVQA、EgoLife-EQA四个基准上,MemLife准确率分别为56.50、52.80、56.18、52.00,均高于表中所有免训练基线;消融显示实体锚定与第一人称叙述各自带来提升,第一人称叙述还稳定提高EgoLifeQA的召回。

MemOpt只对记忆写入器做强化学习,用FIRM奖励同时约束忠实性、信息量与可检索性,从而提升记忆本身的质量。 此前的工作或把强化学习用于最终答案质量,或用监督微调从更强模型蒸馏记忆写入;MemOpt把监督信号拆成三个可验证维度,并用token级忠实性奖励定位不被源视频支持的片段。 MemOpt在四个基准上把MemLife提升到60.35、56.60、58.91、57.00,超过表中所有已训练基线;消融显示可检索性单独提高召回但不稳定提高准确率,加入信息量对SuperMemory-VQA增益明显,完整目标在token级忠实性与乘法聚合下取得两个基准上的最高准确率。

MemOpt训练出的写入器具有跨骨干、跨记忆系统与跨分布的迁移性。 这回答了“学习记住什么”是否只是特定骨干或特定数据集的产物。 在Qwen3.5-9B与Qwen3.6-27B两种写入器、Qwen3.5-9B与Qwen3.6-27B两种读取器的组合中,MemOpt都提升准确率;把优化后的EgoRAG记忆交给MemLife读取器还能进一步提升,而最优结果来自训练过的MemLife写入器;仅在SuperMemory-VQA上训练,却在EgoLifeQA等域外基准上同样提升。

MemLife在存储与读取延迟上具有优势,且默认读取器不需要在提问时访问原始视频。 长时程记忆问答的实际瓶颈之一是每问一次就重看原始片段,MemLife用文本记忆替代这一过程。 效率分析中MemLife的存储为0.68与0.67 MB/h,读取速度为13.1与20.7秒/问题,在所列系统中存储最小、读取最快;MemLife-V允许读取器采样最多50帧,但相对默认MemLife只带来小幅变化。

启示与展望

该结果面向以可穿戴设备采集的第一视角视频、且问题针对用户自身过往经历的长时程记忆问答场景;默认MemLife在提问时不访问原始视频,MemLife-V则在存储与隐私考虑下保存低分辨率脱敏视频并采样有限帧。MemOpt的训练监督来自SuperMemory-VQA的S1–S6受试者,验证用S7–S8,测试用S9–S10,其余基准仅用于测试。对希望构建个人记忆助手的读者,这意味着可以先用手工设计的写入原则获得免训练收益,再用只训练写入器的方式进一步提升,并把训练好的写入器复用到已有记忆系统。

忠实性奖励由同一个冻结模型充当评估者,其判断与源视频的一致性在文本中未给出独立人工核验;可检索性奖励依赖每个epoch开始时缓存的读取器动作,训练与部署之间的读取行为差异会如何影响最终记忆质量仍是开放问题;EgoLife-EQA由作者从官方字幕构造并由两名标注者核验,其92.1%一致率之外的边界情形未展开;此外,读取器训练在域内提升明显但在域外EgoLifeQA上未稳定提高准确率,如何让读取器增益在分布偏移下保持一致被作者列为未来工作。

来源