跳到主要内容
返回时间线
arXiv来源发表:

GeoCoTDrive 用显式几何思维链先定位规划关键区域再取局部三维先验,在 nuScenes、NAVSIM、Bench2Drive 上改善安全类规划指标

核心概要

该工作提出 GeoCoTDrive,一种面向自动驾驶视觉-语言-动作模型的显式几何思维链框架:先自回归定位与自车决策相关的二维区域,再从冻结的几何基础模型特征图中按这些区域采样局部三维几何 token 并交织进自回归上下文以生成轨迹;同时提出规划相关定位任务并构建含 146K 标注的 PlanningGrounding 数据集,在 nuScenes、NAVSIM、Bench2Drive 上改善了安全相关规划指标。

Source-provided article image: Explicit Geometric Chain-of-Thought for Vision-Language-Action in Autonomous Driving
Figure 1 ·

Figure 1: Comparison of geometry integration paradigms for VLA . (a) Structure-perception fusion injects agent and map tokens. (b) Geometric fusion incorporates global geometric tokens. (c) GeoCoTDrive introduces an explicit geometric chain-of-thought pipeline: VLM first grounds planning-relevant regions, then retrieves localized 3D geometric priors, and finally interleaves the grounding text with geometry tokens to condition trajectory generation.

arXiv

深度剖析

GeoCoTDrive 把 VLA 规划建模为“先用二维思考、再用专用三维先验驾驶”的显式几何思维链:模型先自回归生成规划相关二维区域,再据此从冻结几何基础模型的特征图中采样局部几何 token,交织进自回归上下文后继续解码轨迹。 既有空间感知 VLA 多把几何作为全局场景级表示通过隐式特征融合注入,例如 VGGDrive 注入跨视角 VGGT 特征、SpaceDrive 将 UniDepth 三维坐标转为位置编码、LaST-VLA 把 VGGT 几何先验蒸馏进连续隐式 CoT 状态;本文的差异在于几何检索由模型自己生成的二维决策关键区域显式导出。 方法层面给出了完整的自回归公式链条:区域生成、区域采样(框内规则网格加双线性插值)、MLP 对齐头投影到语言空间、几何 token 拼接与交织,以及仅对定位与轨迹响应计算损失的教师强制训练目标;几何基础模型保持冻结。

论文提出规划相关定位这一区域级定位任务,并构建 PlanningGrounding 数据集,共 146K 条 VQA 风格标注,覆盖 critical-object、road-boundary、conflict-area、occluded-unknown-area、dense-object-area 五类,另含 0.6K 人工精修测试样本。 传统目标级定位以人工标注的语义类别对象为基础,可能忽略冲突区域、遮挡区域和密集智能体簇等规划关键空间线索;PlanningGrounding 把标注目标从语义定义的对象转为直接影响自车未来行为的决策关键区域,且以驾驶指令为条件。 数据由前视图像、自车状态和高层驾驶指令构成,经规划导向提示引导 Gemini-3.1 生成区域与类别-理由对,再经自动格式校验和人工验证;原始数据来自 nuScenes(28K)、NAVSIM(102K)、Bench2Drive(16K),类别分布以 road-boundary 37.33% 和 critical-object 34.16% 为主。

在 nuScenes 开环规划上,GeoCoTDrive 平均 L2 为 0.32 m、平均碰撞率 0.11%、平均交叉口率 2.02%,在 VLA 类方法中具有竞争力且安全相关表现较好;在 NAVSIM 上以 Qwen2.5-VL-3B 为底座取得 PDMS 87.6,高于同底座基线 85.9;在 Bench2Drive 闭环上 DS 78.68、SR 55.42,优于 ORION 与 SpaceDrive。 NAVSIM 上相对 Qwen2.5-VL 基线是温和的 PDMS 提升,同时安全相关子指标改善;论文指出在使用更小 VLM 底座的情况下仍具竞争力。 结果来自三个基准的官方评测协议:nuScenes 报告 L2、碰撞率、交叉口率,NAVSIM 报告 PDMS 及其 NC、DAC、TTC、Comf.、EP 子项,Bench2Drive 报告 DS 与 SR;训练使用 8 张 A800 GPU,两阶段各 3 个 epoch。

消融显示几何信息的注入方式与定位标注来源都影响规划:直接交织全局几何 token 收益有限,而按规划相关区域检索局部几何先验带来更一致的改善;用 PlanningGrounding 替代感知标签后,nuScenes 平均碰撞率由 0.12% 降至 0.07%、平均交叉口率由 2.20% 降至 1.44%。 论文进一步扰动定位结果,发现更高的定位 mIoU 持续改善安全相关指标;OmniDrive 虽达到与某个中间 GeoCoTDrive 设置相当的定位 mIoU,其下游安全指标仍更差,作者据此认为增益来自把二维定位证据与局部三维先验显式耦合。 消融覆盖几何集成策略、定位标注来源、几何基础模型(VGGT 与 DA3-LARGE 均优于基线,DA3-LARGE 总体略好、VGGT 的 EP 略高)、采样网格大小(16 与 25 达到相同 PDMS 87.3)以及两阶段训练(单独任一阶段均不如两者结合)。

启示与展望

该结果面向以单目前视图像、自车状态和高层驾驶指令为输入的端到端规划设置,适用于 nuScenes、NAVSIM、Bench2Drive 所覆盖的开环与闭环评测协议。方法可直接受益于两类读者:一是希望在现有 VLA 规划器中加入局部几何条件而不改动几何基础模型的研究者,因为几何模型保持冻结、只需训练 LLM 与轻量对齐头;二是需要区域级规划监督数据的研究者,PlanningGrounding 提供指令条件下的五类区域标注。论文指出后续将把 GeoCoTDrive 扩展到多视角与时序设置并提升定位鲁棒性。

论文自述的适用范围是单目前视输入、不含显式多视角或时序建模,因此对侧后方交通、长时间遮挡和交互历史的刻画有限;局部几何检索依赖定位精度,错误或不完整的区域会带来相关性较低的几何线索并影响轨迹预测。读者可继续关注:定位质量与下游安全指标之间的定量关系在不同基准上是否一致;采样网格大小在 16 与 25 时 PDMS 相同,这一饱和行为在更大规模或更高分辨率输入下是否保持;以及两阶段训练中驾驶知识适配与局部几何条件各自的贡献在不同底座模型上是否稳定。原文部分表格数值未在正文中完整给出,若需精确复现实验设置,应结合附录与代码仓库核对。

来源