跳到主要内容
返回时间线
arXiv来源发表:

浙大团队发布 EMem-Bench:2,554 个长程具身任务显示最强模型 Gemini-3-Flash 平均成功率仅 64.2%,其 EMem 记忆系统把 GPT-5.4-mini 提升 23.6 个百分点

核心概要

浙江大学 OmniAI 团队提出 EMem-Bench 长程具身记忆基准(2,554 个可执行 episode,覆盖被动观察、动态追踪、交互失败、经验泛化四类任务),并给出外部记忆系统 EMem 与 8B 策略 EMem-8B;评测 16 个开源与专有 MLLM 及多种多模态记忆系统后发现,最强专有模型 Gemini-3-Flash 平均成功率仅 64.2%,多数开源模型低于 45%,而 EMem 在匹配骨干下取得最佳总体表现,使 Mistral-Small-3.1-24B 提升 16.4 个百分点、GPT-5.4-mini 提升 23.6 个百分点,EMem-8B 相对 Qwen3-VL-8B 提升 20.6 个百分点。

AI-generated editorial illustration: EmbodiedMemory-Bench: Benchmarking Embodied Memory for Long-Horizon Embodied Tasks

深度剖析

论文通过人工检查 Gemini-3-Flash 与 Qwen3-VL-32B 在 EmbodiedBench 的 EB-ALF 与 EB-Hab 上的 100 条失败轨迹,归纳出四类具身记忆缺陷:遗忘细粒度视觉线索(35%)、忽视环境变化(18%)、未记录交互结果揭示的世界状态(31%)、无法从先前经验泛化(7%),合计约 91%。 此前工作多把长程具身失败归因于规划或感知能力,本文把失败模式直接对应到四种可分别测量的记忆能力,并据此设计基准任务族。 基于 100 条失败轨迹的人工检查与百分比统计,属于诊断性证据,样本规模有限但类别划分明确。

EMem-Bench 包含 2,554 个 episode,分为 Passive Observation(1,036)、Dynamic Tracking(1,052)、Interaction Failure(263)、Experience Generalization(203)四族,跨 1,118 个场景、125 种可见物体、83 种目标类型、33 种容器类型;每个 episode 由多模态交互历史、目标任务与可行动作空间构成,成功与否由模拟器终态判定。 与 MemoryAgentBench、Evo-Memory、WorldMemArena、EmbodiedBench、FindingDory、LMEE-Bench、SpaMEM、WorldLines 等相比,EMem-Bench 是首个在具身交互中同时覆盖视觉、动态、交互结果与经验泛化四类记忆需求的基准。 构建流程包含自动检查与五名领域专家的人工筛查,143 个候选被剔除,保留的 2,554 个 episode 均通过自动执行检查与人工复核。

评测 16 个开源与专有 MLLM 及代表性多模态记忆系统后,最强专有模型 Gemini-3-Flash 平均成功率仅 64.2%,除一个模型外所有开源模型低于 45%;在 400 条采样失败中,61.3% 始于模型依据与交互历史相矛盾的记忆行动。 结果把长程具身记忆从定性描述推进为可量化的能力画像,并显示具身专用模型(如 RynnBrain-8B 3.6%、Cambrian-S-7B 0.8%)并不必然优于通用模型。 基于统一模拟器执行与终态判定的成功率指标,并辅以 Error Recurrence Rate 与失败类型分析。

EMem 将具身经验组织为空间、事件、场景三类记忆,在匹配骨干下取得所评测记忆系统中的最佳总体表现:平均成功率 58.9%,比最强替代方案 TeleMem 高 21.1 个百分点,ERR 降低 11.4 个百分点;在 Mistral-Small-3.1-24B 上提升 16.4 个百分点,在 GPT-5.4-mini 上提升 23.6 个百分点,EMem-8B 相对 Qwen3-VL-8B 提升 20.6 个百分点。 与 MIRIX、MemVerse、TeleMem、MMA 等记忆系统相比,EMem 的三类记忆分别对应不同任务族,消融实验显示移除任一记忆都会降低平均成功率,且各记忆的作用具有任务特异性。 在固定骨干与统一评测协议下比较,并给出消融实验与跨基准(EB-ALF、MMMU-Pro、BLINK、HallusionBench)结果。

启示与展望

该工作面向在模拟环境中执行长程具身任务的智能体研究者与系统开发者:EMem-Bench 提供 2,554 个可执行 episode 与统一评测协议,EMem 提供可插入不同骨干的外部记忆模块,EMem-8B 提供 8B 规模的开源策略基线。论文明确指出,基准与跨基准评测主要在模拟中进行,因此结果适用于受控的模拟具身交互设定,而非真实机器人部署。

论文在 Limitations 中指出,模拟环境不包含传感器噪声、执行误差、开放世界变化或模糊的人类反馈,因此所报告的结果尚不能确立真实物理机器人上的长期记忆表现。此外,加载文本为完整论文正文,但部分附录图表(如 Figure 2、Figure 3、Figure 7、Figure 10 至 Figure 14)以图像形式存在,其具体数值细节需查阅原文图表;四类任务族的样本量差异较大(Interaction Failure 263、Experience Generalization 203),虽然评测采用等权平均以避免大族主导,但小族结果的稳定性仍值得在后续工作中持续观察。

来源