跳到主要内容
返回时间线
arXiv来源发表:

OpenBox 用二维视觉基础模型做跨模态实例对齐,在三个自动驾驶数据集上无需自训练即生成更准更省的三维框标注

相关研究与后续进展

核心概要

OpenBox 提出一个两阶段自动标注流程:第一阶段借助二维视觉基础模型,通过跨模态实例对齐把二维图像中的实例级线索与对应三维点云关联起来;第二阶段按刚性与运动状态对实例分类,并用类别特定的尺寸统计生成自适应三维包围框,从而在无需自训练的情况下产出高质量三维框标注,并在 Waymo Open Dataset、Lyft Level 5 Perception 数据集和 nuScenes 数据集上相对基线取得精度与效率的提升。

Source-provided article image: OpenBox: Annotate Any Bounding Boxes in 3D
Figure 1 ·

Figure 1 : We introduce OpenBox , which utilizes a 2D vision foundation model to annotate 3D bounding boxes automatically. It annotates instances of vehicles, pedestrians, and cyclists. We demonstrate it with Waymo Open Dataset [ 33 ] . Best viewed in color and zoomed in.

arXiv

深度剖析

提出 OpenBox,一个两阶段自动三维包围框标注流程,其核心是用二维视觉基础模型提供实例级线索,并通过跨模态实例对齐把这些线索与对应的三维点云关联。 既有方法多依赖多次自训练迭代来精炼标注,OpenBox 把标注来源转移到二维基础模型的实例线索与跨模态对齐上,从而在流程设计上不再需要自训练。 摘要明确描述了两阶段结构与跨模态实例对齐机制,并说明结果无需自训练;具体对齐算法细节、网络结构与超参未在给定文本中展开。

第二阶段按实例的刚性与运动状态进行分类,并利用类别特定的尺寸统计生成自适应包围框,而不是对所有目标统一套用同一种框生成方式。 针对既有方法“uniformly annotate 3D bounding boxes, ignoring objects' physical states”的做法,OpenBox 显式引入物理状态(刚性、运动)作为分类维度,并让框的尺寸统计随类别变化。 摘要直接陈述了按刚性与运动状态分类以及类别特定尺寸统计这两点;各类别的具体统计量、分类器形式与阈值未在文本中给出。

在 Waymo Open Dataset、Lyft Level 5 Perception 数据集与 nuScenes 数据集上的实验显示,OpenBox 相对基线在精度与效率上均有提升。 相对基线同时报告精度与效率两个维度的改进,呼应了摘要中对既有方法“suboptimal quality and substantial computational overhead”的问题设定。 证据来自三个具名自动驾驶数据集的实验对比;给定文本未提供具体指标数值、基线名称、消融设置或统计显著性信息。

启示与展望

该工作面向自动驾驶场景下的三维目标检测标注,适用于希望减少人工标注成本、并需要识别未见类别的数据生产流程;其设定是借助二维视觉基础模型与跨模态实例对齐,在无需自训练的前提下生成三维包围框,并按刚性与运动状态、类别特定尺寸统计做自适应生成。摘要所述验证范围是 Waymo Open Dataset、Lyft Level 5 Perception 数据集与 nuScenes 数据集,因此可直接沿用的场景是这些数据集所代表的传感器与道路环境;若要迁移到其他传感器配置、其他目标类别或其他领域,需要重新评估对齐与尺寸统计的适用性。

给定文本为摘要级信息,未包含具体精度与效率数值、基线名称、消融实验、失败案例分析以及类别特定尺寸统计的构造方式,因此无法判断提升幅度与在哪些类别或场景下更明显。跨模态实例对齐在遮挡、稀疏点云或二维检测缺失时的行为,以及刚性与运动状态分类的判定依据,均属需要查阅原文才能确认的开放问题。此外,摘要提到项目页面但未在文本中给出可核验的链接内容,相关实现细节与数据划分仍有待原文补充。

来源