HIDE 基准与 SEEK 记忆框架:15 项隐藏状态任务上平均成功率 62.9%,比最强基线高 11.7 个百分点
核心概要
作者提出 HIDE——一个基于 RLBench、包含 15 项任务(重复计数、历史状态回忆、执行进度跟踪)的部分可观测操作记忆基准,并给出 SEEK 框架,用窗口上下文记忆、持久锚点记忆和阶段计数器记忆三种机制保留历史证据与执行状态;评测显示现有策略在 HIDE 上存在明显局限,SEEK 在仿真中取得 62.9% 平均成功率、超过最强基线 SAM2Act+ 11.7 个百分点,并在真实机器人四项任务上达到 89% 平均成功率。
深度剖析
论文把机器人操作记忆问题形式化为“隐藏任务状态”:存在两段不同交互历史导致视觉上等价的当前观测、却需要不同最优动作,并据此构建 HIDE 基准,含重复计数、历史状态回忆、执行进度跟踪三类共 15 项任务,每类 5 项。 此前 RLBench、CALVIN、LIBERO、RoboCasa 等基准主要关注任务完成与泛化,MemoryBench、MIKASA-Robo、RoboMME、RoboMemArena、RMBench、LIBERO-Mem 等记忆类基准多以任务长度、场景复杂度或保留上下文量衡量记忆需求;HIDE 改为按“正确决策所需的隐藏变量”组织任务,显式构造当前观测不足、必须依赖历史的决策点。 基于 RLBench 构建,支持随机化初始配置与外观变化、自动演示生成和结构化隐藏状态标注;每项任务 100 条训练演示、25 个留出测试回合,任务难度可通过重复次数、干扰物数量与相似度、信息性观测到决策的间隔、操作阶段数系统调节。
SEEK 用三种互补记忆机制——窗口上下文记忆(WCM)保留最近交互、持久锚点记忆(PAM)按当前观测检索已离开窗口的历史条目、阶段计数器记忆(SCM)用离散计数器与学习到的阶段嵌入表示执行进度——并在 SAM 2 式注意力中读取,读取预算固定为最多 6 条最近条目、1 个锚点和 1 个阶段表示。 已有记忆策略通过时间窗口、循环状态或记忆库保留历史,但论文指出“保留历史不等于恢复所需隐藏状态”;SEEK 按显式隐藏状态需求拆分记忆职责,并区分“描述过去交互”的 WCM/PAM 与“指示执行到哪一步”的 SCM。 SEEK 建立在语言条件、由粗到细的多视角策略之上,粗分支用记忆条件特征预测工作空间平移热图,细分支在当前局部几何上精化动作;记忆在动作预测后写入,仅允许检索先前观测,回合间重置;训练为两阶段行为克隆,阶段 1 学习无记忆策略并 LoRA 适配视觉骨干,阶段 2 冻结视觉骨干训练记忆与阶段相关参数。
在 HIDE 上,现有策略表现受限且优势按类别分化:SAM2Act+ 把平均成功率从 SAM2Act 的 42.7% 提升到 51.2%,但在重复计数与历史状态回忆上仅 46.4%,而 MME 在历史状态回忆上为 35.2%、在重复计数上仅 2.4%;SEEK 取得 62.9% 平均成功率,三类分别为 61.6%、59.2%、68.0%,对应比最强类别基线高 15.2、9.6、7.2 个百分点。 论文用同一基准同时比较视觉-语言-动作模型、3D 操作策略与记忆类方法,显示“最强基线随类别变化”(SAM2Act+ 领先重复计数与执行进度跟踪,GR00T-N1.7 以 49.6% 领先历史状态回忆),而 SEEK 在三类上均领先。 15 项任务联合训练单一策略,报告逐任务成功率、类别平均与 15 项总体平均;消融显示存储视觉特征相比本体感觉把平均成功率从 42.5% 提升到 62.9%(重复计数 +30.4、历史状态回忆 +17.6、执行进度跟踪 +13.4),记忆长度从 0 增至 6 时平均成功率由 46.7% 升至 62.9%,重复计数在长度 2 时先降至 44.2% 再随更长上下文升至 61.6%。
SEEK 在 HIDE 之外也保持表现:标准 18 项 RLBench 上平均成功率 84.7%(略高于其 SAM2Act 复现的 84.1%,高于 RVT-2 的 81.4% 与 RVT 的 62.9%);The Colosseum 上干净场景 68.6%、扰动平均 61.9%,相对下降 9.8%;真实机器人四项任务平均成功率 89%,对比 SAM2Act+ 的 47%。 论文把记忆设计放到标准操作、环境扰动与真实执行三类场景中检验,说明引入记忆并未以牺牲标准任务表现为代价,并给出真实机器人上的对照结果。 真实机器人使用 Franka Emika Panda 配 Robotiq 夹爪与 Intel RealSense D455,每项任务采集 50 条演示、在 25 次测试试验上评估,任务变化在采集与评估中均匀覆盖;四项任务为按指定次数按键、按指定数量叠杯、清理桌面、抬起积木寻找白色小片。
启示与展望
这项工作面向需要在交互历史中恢复隐藏状态的操作场景:重复计数、历史状态回忆与执行进度跟踪,评测在 RLBench 派生的仿真环境与受控室内真实机器人环境中进行,真实任务为按键、叠杯、清理桌面与寻找隐藏白色小片。对希望评估或设计记忆机制的研究者,HIDE 提供了带结构化隐藏状态标注、随机化配置与自动演示生成的对照平台,SEEK 则给出“最近上下文 + 持久锚点 + 执行进度”这一可组合的记忆模板,并说明记忆读取预算可固定而不随历史长度增长。论文明确把当前范围限定在受控且可解释的隐藏状态形式,并指出扩展到更丰富的真实场景、更广的部分可观测来源与更通用的记忆机制是后续方向。
仍可继续观察的是:HIDE 目前聚焦受控且可解释的隐藏状态,更丰富的真实世界部分可观测来源是否呈现同样的机制分工尚待检验;三类记忆机制在论文任务之外的组合方式与读取预算是否仍适用,需要更多任务分布上的验证;真实机器人结果基于四项任务、每项 25 次测试试验,任务变化虽在采集与评估中均匀覆盖,但任务种类有限;此外,本次可读文本中 The Colosseum 的逐扰动细分表格为空,因此只能依据干净场景与扰动平均的汇总数字理解其鲁棒性表现。
