arXiv 2025年12月1日OpenBox 提出一个两阶段自动标注流程:第一阶段借助二维视觉基础模型,通过跨模态实例对齐把二维图像中的实例级线索与对应三维点云关联起来;第二阶段按刚性与运动状态对实例分类,并用类别特定的尺寸统计生成自适应三维包围框,从而在无需自训练的情况下产出高质量三维框标注,并在 Waymo Open Dataset、Lyft Level 5 Perception 数据集和 nuScenes 数据集上相对基线取得精度与效率的提升。OpenBox 提出一个两阶段自动标注流程:第一阶段借助二维视觉基础模型,通过跨模态实例对齐把二维图像中的实例级线索与对应三维点云关联起来;第二阶段按刚性与运动状态对实例分类,并用类别特定的尺寸统计生成自适应三维包围框,从而在无需自训练的情况下产出高质量三维框标注,并在 Waymo Open Dataset、Lyft Level 5 Perception 数据集和 nuScenes 数据集上相对基线取得精度与效率的提升。OpenBox 用二维视觉基础模型做跨模态实例对齐,在三个自动驾驶数据集上无需自训练即生成更准更省的三维框标注OpenBox 提出一个两阶段自动标注流程:第一阶段借助二维视觉基础模型,通过跨模态实例对齐把二维图像中的实例级线索与对应三维点云关联起来;第二阶段按刚性与运动状态对实例分类,并用类别特定的尺寸统计生成自适应三维包围框,从而在无需自训练的情况下产出高质量三维框标注,并在 Waymo Open Dataset、Lyft Level 5 Perception 数据集和 nuScenes 数据集上相对基线取得精度与效率的提升。OpenBox 提出一个两阶段自动标注流程:第一阶段借助二维视觉基础模型,通过跨模态实例对齐把二维图像中的实例级线索与对应三维点云关联起来;第二阶段按刚性与运动状态对实例分类,并用类别特定的尺寸统计生成自适应三维包围框,从而在无需自训练的情况下产出高质量三维框标注,并在 Waymo Open Dataset、Lyft Level 5 Perception 数据集和 nuScenes 数据集上相对基线取得精度与效率的提升。