Remory 用残差记忆令牌补足摘要,在 SummHay 上把引用 F1 提升 4.04 分并逼近全上下文联合得分
核心概要
Remory 训练一个神经记忆网络,在生成的摘要之后追加一段有界的软记忆令牌,帮助冻结的 LLM 逼近使用完整历史时的续写;在 SummHay 上以约 5.2% 的输入位置把引用 F1 提升 4.04 分、联合得分提升 3.55,并在 Qwen3.8-27B 与 GLM-5.3-Flash 的长程智能体基准上取得一致增益,同时减少重复工具输出与工具错误。
Figure 1: BrowseComp and Terminal-Bench 2.1 scores. Pale and solid bars compare the same local actor without and with residual memory. Gray bars are published frontier references, with their original harnesses and protocols ( Google DeepMind, 2026 ; Terminal-Bench Team, 2026 ; OpenAI, 2026b ) ; they are not controlled comparisons with our runs.
arXiv深度剖析
Remory 把压缩后的摘要当作可读检查点,再在其后追加一段有界的连续软记忆令牌,作为沿序列维度的残差连接,使冻结的 actor 更接近使用完整历史时的续写。 此前的智能体记忆方案多以摘要加检索为主,连续压缩方法则学习长文本的连续表示;Remory 保留文本检查点与检索接口,额外学习一个以检查点为条件的连续表示。 摘要与软令牌的构造方式、每 1,024 个源位置产生 64 个软令牌、最终记忆上限 4,096 个槽位,以及 Qwen3.8-27B 与 GLM-5.3-Flash 上分别为 1.94B 与 1.502B 可训练参数的记忆网络,均在正文中给出。
在 SummHay 上,残差记忆在洞见覆盖率几乎不变的情况下提升来源归因:引用 F1 提高 4.04 分,联合得分提高 3.55,覆盖率变化 0.40。 与使用同等额外位置预算的文本补充(summary++)相比,学习到的补充更能保留归因线索;summary++ 的联合得分仍接近仅用摘要。 评估覆盖十个集合的全部 92 个查询,覆盖率与联合得分在 621 条参考洞见上平均,引用 F1 在已覆盖洞见上平均;在两种摘要条件共同覆盖的 553 条洞见上,引用 F1 仍从 57.31 升至 61.41;联合得分增益给出配对集合自助法的 95% 区间,且以已生成与已评判的输出为条件。
在长程智能体基准上,残差记忆带来一致增益:Qwen 在 AutomationBench 提升 9.8 分、JobBench 提升 7.6 分、Terminal-Bench 提升 4.5 分、BrowseComp 提升 3.0 分;GLM 在 Terminal-Bench 与 BrowseComp 分别提升 3.3 与 4.1 分。 增益在更强、上下文窗口更大的 actor 上同样成立,说明该接口不限于单一模型规模。 每个 actor 内比较固定权重、Codex CLI 框架、提示、工具、解码、预算与压缩策略,两种配置都可检索精确历史;使用完整任务集(BrowseComp 1,266 与 Terminal-Bench 89 各一次运行,AutomationBench 600 与 JobBench 65 对 Qwen 五次运行),Terminal-Bench 与 AutomationBench 使用任务验证器,BrowseComp 与 JobBench 使用匹配的 GPT-5.6-Sol 评判。
残差记忆减少重复工具输出与工具错误,并在压缩后的首个动作上获得偏好:四个 actor–基准组合中重复输出下降 17.9–29.8%、错误下降 25.3–49.7%;488 个配对后续动作中残差动作取得 345 胜(70.7%)、21 平(4.3%)、122 负(25.0%)。 这些结果把记忆通道与压缩后的首个决策联系起来,并提示对早期反馈的使用更充分。 重复计数同一任务内同一工具的相同输出(排除规划与轮询),错误计数失败命令或显式工具错误;动作偏好评估固定持久提示与摘要,隐藏候选推理且不执行反事实调用,属于对提议动作的评判而非结果测量。
启示与展望
该工作面向需要在有限窗口内持续工作的长程智能体:摘要提供可读检查点,软令牌携带额外的预测信息,检索在需要时提供精确记录。方法在冻结 actor 上训练记忆接口,因此适用于已有可用的 actor 与压缩策略、且允许在压缩边界追加最多 4,096 个残差槽位的场景。SummHay 的评估在无工具、无归档访问、无来源检索的条件下进行,用于隔离表示本身的作用;端到端评估则保留精确历史检索能力。成本估计按 2026 年 9 月未缓存供应商费率计价,计入残差位置作为输入,但不含源特征编码、记忆网络执行与工具开销,因此衡量的是按令牌计价的生成成本而非总执行成本。
联合得分增益的 95% 区间以已生成与已评判的输出为条件,因此其范围随生成与评判过程而定。首个动作的偏好评估是对提议动作的评判,并未测量这些反事实动作会产生的结果。Live Trading 案例中两条轨迹在市场选择与时机上不同,限制了收益比较;每 1,000 次响应的压缩次数反而从 10.5 升至 14.9,说明总压缩次数下降伴随交互减少。细胞分割案例说明摘要、记忆与检索的互补作用,但未确定哪些被省略的细节来自记忆。成本估计不含源特征编码、记忆网络执行与工具开销。此外,正文中的若干公式与图(如式 1–3、图 1–5)在解析文本中未完整呈现,若需核对具体形式与曲线,应查阅原文。
