EvolvingNav用时间索引的4D信念预测目标去向,在EvoWorld-Bench上把首次检查成功率从45.33%提升到61.32%
核心概要
该工作提出EvolvingNav,用带时间戳的3D物体历史构建“持续—迁移”信念,并通过事件驱动的预测—观察—重规划滤波器在目标可能于查询前或导航途中被移动的情况下推断其当前位置,同时发布包含54个场景、803,680个任务的EvoWorld-Bench基准,在仿真与真机实验中相比所评估基线提升了导航成功率与搜索效率。
深度剖析
论文把“演化世界导航”形式化为一个新问题:智能体只有查询时刻之前的因果观测历史,目标可能在查询前移动,也可能在导航执行过程中继续移动,因此必须估计到达候选地点那一刻目标是否还在那里。 此前工作分别研究时间预测与移动目标导航,例如PredictiveGraphs预测未来物体—容器状态并在导航中更新估计,Transit-Aware Planning考虑在智能体行进途中移动的便携目标;本文把不规则观测历史、候选地点各自的到达时间、以及可见性条件下的证据整合进同一个导航回路。 问题设定在正文第1节与第3.1节给出形式化定义,并区分固定目标回合与持续演化回合两类情节。
EvolvingNav用“持续—迁移”分解构建时间索引信念:既预测目标停留在最后观测位置的概率,也用共享指针头为每个备选位置打分,并保留已知候选集合之外的概率质量。 与直接对候选做归一化的Transformer相比,该结构化分解把“留在原地”和“迁往他处”分开建模;消融显示去掉预测信念后首次检查成功率从62.17%降至12.51%,直接候选预测使首次检查/搜索成功率下降13.84/15.75个百分点。 预测质量上,相对Direct Transformer,本文预测器在时间划分上Top-1提高4.08个百分点、留一场景上提高9.47个百分点,NLL分别下降0.2367与0.3379。
事件驱动的预测—观察—重规划滤波器按各候选的预计到达时间预测占用概率,并用可见性条件下的检测概率做软更新:未检测到目标只按校准后的似然下调该位置假设,而不是永久删除,且时间有效的证据轮次避免重复使用同一批观测。 消融显示硬删除在排序、Top-1、NLL、ECE四项指标上全面变差,而校准后的贝叶斯更新取得最佳排序、Top-1与ECE;去掉证据更新使搜索成功率下降42.02个百分点、检查次数升至6.48。 正文给出一次具体更新示例:因果记忆最初给最后见到的咖啡桌0.62概率,校准器给出检测概率后未检测到目标使该状态似然为0.069,后验随之转移,但被检查状态仍保留非零质量。
论文发布EvoWorld-Bench:基于人类活动轨迹构建,包含54个场景、803,680个任务实例,并用配对的静态、常规、随机世界在保持场景与查询不变的情况下只改变隐藏转移机制。 配对控制把“利用历史规律”与“利用类别频率或空间便利”区分开:相对Last Seen,常规世界成功率提升22.36个百分点,随机转移下仅提升6.93个百分点,说明优势主要来自可学习的时间规律。 基准构建区分测量、环境导出、模拟与基准自撰量,并做时间与元数据泄漏、划分重叠、配对一致性、物理有效性与巡逻访问隐藏状态的审计。
启示与展望
该结果面向需要在重复访问中寻找可移动目标的具身智能体,适用于家庭等存在人类活动规律、且目标可能在查询前或导航途中被移动的场景;方法依赖带时间戳的3D观测历史、合法候选集合与可到达的检查视点,并需要一个冻结的零样本视觉语言控制器来调用记忆、预测、检查、探索与导航工具。对读者而言,这意味着可以把“到达时刻的状态预测”作为记忆系统的输出接口来设计,而不是只存储最后观测位置;真机部分使用DEEP Robotics的LYNX M20为主平台,X30与Lite3用于迁移子集,说明该信念接口可跨平台复用。
正文指出未来工作将处理相互作用的物体与持续变化的目标,说明当前设定尚未覆盖这些情形。配对实验显示优势集中在可学习的时间规律上:随机转移下相对Last Seen的增益降至6.93个百分点,且落后Direct Transformer 1.27个百分点;跨环境结果中R2R-CE成功率由Uni-LaViRA领先,SAGE-Bench的SPL也由NaVILA领先,因此不宜把结论推广为在所有导航协议上一致占优。行为偏移诊断显示相位偏移、返回延迟、目的地偏移等条件下所有方法的在线恢复成功率都会下降,作者明确不将其视为无限制的分布外泛化证据。此外,真机成功要求360秒内三次检查内完成在线确认,错过检测、导航失败、超时与人工干预均计为失败,这一判定口径会影响结果解读。
