跳到主要内容
返回时间线
arXiv来源发表:

AdaGeoVLN:在表示深度与导航时间两个维度上选择性使用几何信息

核心概要

该工作提出 AdaGeoVLN 流式视觉语言导航框架,将 VGGT 几何基础模型在深度 11、17、23 的中间表示分别耦合到 Qwen3.5-4B 的前三个解码层,并按指令相关性、几何置信度与转移新颖度在固定预算下保留历史 VGGT 全局注意力 KV 状态,在 R2R-CE 与 RxR-CE Val-Unseen 上仅用单路 RGB 流、不额外使用导航专用外部数据即取得 55.7%/51.4% 与 54.1%/44.7% 的 SR/SPL,消融显示多深度耦合显著优于在相同融合位置重复注入末端特征,且受限的导航感知保留在降低 GFM-KV 内存的同时保持导航性能。

Source-provided article image: AdaGeoVLN: Selective Geometry Across Representation Depth and Navigation Time for Vision-Language Navigation
Fig. 2 ·

Fig. 2 : Hierarchical GFM–VLM fusion across representation depth. VGGT depths 11, 17, and 23 are coupled to Qwen3.5-4B decoder layers L 0 L_{0} , L 1 L_{1} , and L 2 L_{2} . Each branch applies RMSNorm, 2 × 2 2\times 2 grouping, projection, token-wise gating, and a learned scale before residual addition at image-token positions.

arXiv

深度剖析

跨表示深度的几何选择:把 VGGT 深度 11、17、23 的表示分别耦合到 Qwen3.5-4B 解码层 L0、L1、L2,而非反复注入末端特征。 相对只暴露几何编码器末端表示或重复注入同一末端特征的常见做法,这里让不同几何深度的表示进入不同的策略推理阶段,且不预设各层的语义角色。 在 R2R-CE Val-Unseen 上,分层融合相比无几何策略提升 SR/SPL 9.2/9.1 个百分点,相比单深度融合提升 6.8/7.3 个百分点,相比融合位置与次数匹配的 Deep×3 控制组提升 13.6/14.5 个百分点。

导航条件化的几何记忆:在固定容量下,依据指令相关性、几何置信度与转移重要性,对 VGGT 全局注意力 KV 状态做 TopK 保留。 相对以观测新旧程度为效用代理的时序保留策略,这里让导航效用(指令子目标匹配、深度与点图置信度、视角转移新颖度)决定哪些历史几何证据可供后续几何推断使用。 在相近 KV 占用下,Nav. 900K 相比 Hybrid Inc. (8+24) 提升 SR/SPL 0.6/1.1 个百分点,同时平均 GFM-KV 内存减少 3.33%、平均已分配 GPU 内存减少 9.35%;相比 Hybrid Inc. (8+48) 提升 SR/SPL 0.4/1.4 个百分点,KV 与已分配 GPU 内存分别减少 39.73% 与 20.22%。

保留信号的留一消融:在 900K 固定预算下,去掉指令相关性、几何置信度或转移重要性中的任一项都会同时降低 SR 与 SPL。 该消融在 KV 内存几乎不变(波动仅 0.20 MB)的条件下比较各信号贡献,说明完整评分优于任何两信号组合,而非仅比较权重最优性。 去掉置信度导致最大 SR 下降(2.1 个百分点),其次是指令相关性(1.5 个百分点)与转移重要性(1.4 个百分点)。

仿真基准与真机演示:在 R2R-CE 与 RxR-CE Val-Unseen 上评测,并将策略部署到 Unitree G1 人形机器人。 相对表中列出的代表性方法,AdaGeoVLN 在单路 RGB 流、无额外导航专用外部数据的设定下报告了较强的 SR/SPL,并给出仿真与室内真机执行的定性证据。 R2R-CE 上 SR 55.7%、SPL 51.4%,相比 JanusVLN* 分别高 2.9 与 2.2 个百分点;RxR-CE 上 SR 54.1%、SPL 44.7%、nDTW 61.8、NE 5.64 m,相比 JanusVLN* 的 SR、SPL、nDTW 分别高 2.7、0.4、2.7 个百分点,NE 降低 0.82 m;真机部分为两次室内试验的定性展示。

启示与展望

该结果面向在连续环境中执行指令的流式视觉语言导航智能体,适用于仅提供单路 RGB 流、无全景、无里程计、无深度输入,且不额外使用导航专用外部训练数据的设定;评测覆盖 R2R-CE 与 RxR-CE 的 Val-Unseen 划分,消融主要在 R2R-CE Val-Unseen 上进行,真机演示为 Unitree G1 搭配 ZED X Mini 相机的室内试验。它为进一步研究几何表示深度与历史证据保留的联合设计、以及在其他几何基础模型与策略骨干上的迁移提供了起点。

保留系数被固定为相等权重且未调优,作者也指出信号消融并未确立最优权重,调参或学习权重仍属未来工作;预算敏感性显示 600K 到 900K 之间 SR/SPL 随容量提升,因此更大预算或其他分配方式下的表现仍是开放问题;真机部分为两次室内试验的定性展示,其在不同环境与更长轨迹下的表现有待进一步观察;此外,跨方法比较需结合表中列出的传感假设与外部监督差异来解读。

来源