MapLightning用1D地图token替代稠密BEV网格,在nuScenes上比MapTRv2提升10.1 mAP并提速1.73倍
相关研究与后续进展核心概要
MapLightning提出用一组紧凑的1D可学习地图token替代稠密BEV网格作为在线矢量化高精地图构建的中间表示,其transformer映射器将地图token与图像token拼接后做全自注意力、丢弃图像token并保留更新后的地图token用于解码;该设计使中间token最多减少16.7倍,在nuScenes和Argoverse 2上取得精度与效率的领先结果,轻量变体在nuScenes上比MapTRv2高10.1 mAP、在Argoverse 2上高16.2 mAP,同时推理快1.73倍(40+ FPS)、内存少53%,并在不确定性感知地图构建与下游轨迹预测上显示改进。
Figure 3: Image-to-image attention in the self-attention mapper. We select one image token as the query (magenta cross) and visualize its attention scores over the other image tokens, which serve as keys (red: high, blue: low), at the first and last ( L = 4 L=4 ) mapper layers. From left to right: (1) a query on a lane divider attends along that divider and to the parallel divider across the lane; (2) a query on a lane divider attends along the divider’s full extent toward the horizon; (3) a query on a pedestrian crossing attends across the crossing’s full width; and (4) a query on a road boundary attends along the curb. From Layer 1 to Layer 4, responses on these structures become stronger and more complete, while diffuse background responses (e.g., the sky in column 4) fade, illustrating progressive refinement of the image tokens. Such image-to-image interaction is absent in cross-attention, where image tokens serve only as fixed keys and values. Best viewed zoomed in.
arXiv深度剖析
以1D可学习地图token集合替代稠密BEV网格作为中间表示,并让地图token与图像token拼接后经全自注意力交互,再丢弃图像token、仅保留更新后的地图token用于解码。 此前在线矢量化高精地图构建方法通常以稠密BEV网格作为中间表示;该工作改用紧凑的1D地图token,并选择自注意力而非普通交叉注意力,以获得图像与地图token之间的联合交互与上下文聚合。 摘要报告该表示最多使用比稠密BEV方法少16.7倍的中间token,并称在nuScenes与Argoverse 2上同时达到领先的精度与效率。
轻量设计使地图解码器可以采用全交叉注意力而非可变形交叉注意力,从而获得更好的全局上下文。 在BEV类方法中,解码器通常受限于可变形交叉注意力;该工作指出其轻量表示允许使用全交叉注意力。 摘要将该点列为设计的第二项优势,属于设计层面的论证,未给出单独的消融数值。
网络不使用相机投影参数,因而对相机外参扰动具有鲁棒性。 与依赖相机投影参数的BEV类方法不同,该设计在表示层面去除了这一依赖。 摘要以与BEV方法的对比方式陈述该性质,未给出扰动实验的具体数值。
轻量变体在nuScenes上比MapTRv2高10.1 mAP、在Argoverse 2上高16.2 mAP,同时推理快1.73倍(40+ FPS)、内存少53%,并在不确定性感知地图构建与下游轨迹预测上显示改进。 相对MapTRv2这一既有基线,该工作在精度、速度与内存三项上同时给出改进,并延伸到不确定性感知构建与轨迹预测任务。 摘要给出nuScenes与Argoverse 2两个数据集上的mAP差值、1.73倍推理加速、40+ FPS与53%内存节省等具体数字,并称代码与模型将发布。
启示与展望
该工作面向在线矢量化高精地图构建这一自动驾驶感知任务,适用于以车载多相机图像为输入、需要实时输出的场景;摘要称其在nuScenes与Argoverse 2上达到领先的精度与效率,并给出轻量变体相对MapTRv2的mAP提升、1.73倍推理加速、40+ FPS与53%内存节省。其表示层面的特点是不使用相机投影参数,因而在相机外参扰动下具有鲁棒性,这对相机标定不稳定的部署环境具有参考价值。摘要还提到在不确定性感知地图构建与下游轨迹预测上的改进,说明该表示可被复用于与地图相关的后续任务。代码与模型将发布,为复现与在自有数据上迁移提供条件。
当前可读范围仅为摘要,未包含网络结构细节、训练配置、消融实验与相机外参扰动实验的具体设置,因此无法判断各项优势分别来自哪一设计选择。摘要中的16.7倍token缩减、+10.1与+16.2 mAP、1.73倍加速、40+ FPS与53%内存节省均以摘要陈述为准,其统计口径与对比条件需在原文中核对。不确定性感知地图构建与下游轨迹预测的改进幅度未在摘要中给出数值。代码与模型在摘要中表述为将发布,实际可用性与复现条件有待确认。
