PanoVLN 用全景视觉把 R2R-CE 成功率推到 77.3%,比此前最好结果高 11.9 个百分点
核心概要
PanoVLN 以 4B 视觉语言模型和纯 RGB 全景输入做连续环境视觉语言导航,通过更长动作序列监督、置信度引导执行、面向决策的训练数据与全景几何特征融合,在 R2R-CE 与 RxR-CE Val-Unseen 上把成功率提升到 77.3% 和 78.0%,分别超过此前最好结果 11.9 和 8.7 个百分点,并在四足机器人上实现更少停顿的实机导航。
深度剖析
论文发现把透视图像直接换成等距柱状全景(ERP)在相同训练与推理设置下收益有限、甚至可能降低性能,并据此诊断出需要同时改造动作预测、训练监督与视觉表征三处。 此前多数 VLN 工作以透视图像为输入,本文把“全景是否天然更好”当作需要验证的问题,而不是默认前提,并给出输入替换无效这一对照观察。 论文报告在相同 VLM、训练轨迹、动作监督与执行流程下仅替换输入,收益有限甚至下降,并由此展开后续消融。
更长动作序列监督配合置信度引导执行(CGE)让模型从单张全景预测并执行更长的动作段,CGE 依据动作不确定性决定执行多少步后再重新观察与重规划。 以往策略在推理时执行固定长度的预测前缀,本文把执行长度变成由预测不确定性动态决定,并把预测视野与执行长度区分为两个独立选择。 预测视野消融显示 ERP 策略在短视野下落后于透视策略、随目标变长而反超,透视在较短视野达峰而 ERP 偏好更长视野;执行消融中 CGE 优于随机前缀与所有固定策略,包括单动作执行。
论文构建了 98K 条轨迹、覆盖 800 个 HM3D 场景的决策导向数据集,路线含频繁分叉点并配以明确指示所选路径的指令,指令经运动一致性、选择落地与停止落地三项校验。 既有 VLN 训练数据中分叉点相对稀疏,对“从全景中选出正确路径”的监督不足;本文在数据构造阶段就针对路线选择与终止加密采样。 在相同轨迹数量下与 ScaleVLN 及用同一指令流程重写指令的 ScaleVLN-rewrite 比较,重写指令本身带来增益,完整流程在多个训练规模上进一步提升;加入该数据后 SR 再提升 3.4/3.9 个百分点、SPL 提升 2.7/2.0 个百分点。
把 PanoVGGT 从同一张 RGB 全景提取的几何特征与 VLM 语义特征按 ERP 区域对齐并残差融合,在不增加视觉 token 的前提下同时保留场景内容与空间布局。 VLM 视觉特征主要承载语义,本文在不引入深度输入、不增加 token 数的条件下补入全景几何,使地标与相邻通道、方向建立联系。 在相同融合设计、视觉 token 预算与 CGE 下比较冻结的 UniK3D、DA2、DAP 与 PanoVGGT 编码器,替代编码器效果不一,PanoVGGT 在两个基准上均提升 SR。
启示与展望
这项工作面向以自然语言指令在室内外连续环境中导航的具身智能体,尤其是配备全景相机、需要同步调用远程策略的机器人平台。它说明更宽的可见范围要转化为性能,需要在监督视野、执行长度与视觉表征上同步调整,因此对使用全景或大视场传感器的导航系统、以及需要减少策略调用与停顿的实机部署具有直接参考意义。论文的仿真评测限定在 R2R-CE 与 RxR-CE 的 Val-Unseen 划分、Matterport3D 场景与 Habitat 平台,实机评测使用 Unitree Go2、Insta360 X5 与远程 RTX 3090,在 20 组共享指令—路线对上比较五种方法且不做场景特定微调。
论文正文中若干数值在加载文本里以占位形式出现,例如摘要与实验小节中的成功率、提升幅度、视野取值、CGE 预算与最小执行步数、残差尺度、学习率与网络开销等,部分只能从其他段落或附录表格间接确认,因此对具体超参与逐项指标的复现需要回到原文核对。实机部分在每类场景使用 20 组共享指令—路线对,样本规模有限,跨更多场景与更长路线的稳定性仍是开放问题。此外,几何编码器为冻结使用,语义与几何融合的残差尺度固定,这一设计在其他传感器配置或室外光照条件下的表现尚待观察。
