GeoScaffold 用训练期几何重建监督把深度、连通性与可通行性内化进 Video-LLM 导航策略,在连续 VLN 基准上稳定超过纯视觉导航器
相关研究与后续进展核心概要
该工作提出 GeoScaffold 几何监督框架:先在训练轨迹的深度图上学习一个紧凑深度分词器并冻结,再用少量可学习几何查询 token 微调策略,令其隐藏状态重建深度、连通性与可通行性等导航关键几何,从而把几何内化进策略本身;训练后分词器、目标生成器与重建头全部丢弃,主干与动作接口保持不变,实验显示其在连续 VLN 基准上稳定优于领先的纯视觉导航器,为空间感知具身导航模型的轻量边缘部署提供了一条实用路径。
Figure 1: Comparison of end-to-end VLN paradigms. (a) Streaming Video-LLMs act directly from RGB, but lack 3D perception. (b) Geometry-enhanced policies add a spatial encoder, but it stays resident at inference and geometry is never internalized. (c) GeoScaffold internalizes geometry via training-only query-token supervision, leaving the deployed RGB-and-text action path unchanged.
arXiv深度剖析
提出把几何监督一次性放在训练期的框架:先训练并冻结紧凑深度分词器,再以少量可学习几何查询 token 的隐藏状态重建导航关键几何。 相对于依赖深度传感器、3D 编码器或逐步感知工具调用的既有几何感知扩展,该方法不在推理期持续付出代价,而是把几何内化进策略。 摘要明确描述了训练流程与监督目标(深度、连通性、可通行性),并说明推理期不再需要这些组件。
几何查询状态成为用于动作解码的紧凑几何潜变量,并通过共享权重把几何内化进主干自身表征。 把几何信息从外部模块转移到策略内部表征,使动作解码直接受益于几何潜变量。 摘要说明监督使查询状态转化为紧凑几何潜变量,并经由共享权重影响主干表征。
训练后分词器、目标生成器与重建头被丢弃,主干与动作接口保持不变,形成类似脚手架的一次性结构。 与需要保留额外几何模块的扩展相比,该方法在部署时保持原有接口,便于轻量边缘部署。 摘要明确说明这些组件在训练后被丢弃,主干与动作接口不变。
在连续 VLN 基准上,GeoScaffold 稳定优于领先的纯视觉导航器。 在无需推理期几何输入的前提下取得优于纯视觉基线的表现。 摘要以“Extensive experiments”与“consistently outperforms”概括实验结论,未给出具体数值、基准名称或样本量。
启示与展望
该框架面向采用流式 Video-LLM 策略、以自我中心 RGB 观测与指令直接映射到低层动作的连续 VLN 设定,其收益来自训练轨迹中可获得的深度图;适用对象是希望在不引入推理期深度传感器、3D 编码器或逐步感知工具调用的前提下提升空间感知的具身导航系统,尤其是面向轻量边缘部署的场景。方法在训练后丢弃分词器、目标生成器与重建头,因此部署侧只需保留原有主干与动作接口。
摘要以“Extensive experiments”和“consistently outperforms”概括结果,未列出具体基准名称、评价指标、提升幅度或样本规模,因此无法从摘要判断优势的量级与稳定性边界。深度分词器的紧凑程度、几何查询 token 的数量、重建目标的具体形式,以及在不同训练轨迹深度质量下的表现,均需在正文中确认。此外,摘要未说明该方法在缺乏可靠深度监督信号或跨域场景下的适用性,这些属于值得进一步观察的开放问题。
