跳到主要内容
返回时间线
arXiv来源发表:

ViRA 用冻结视觉基础模型对齐规划器中间特征,在 NAVSIM v2 navtest 上把 Rap∗ 从 72.8 提升到 83.7 EPDMS,并推出 92.3 EPDMS 的 ViRA-Diffusion

核心概要

作者提出 ViRA——一种与规划器无关的视觉表征对齐框架,在训练时用冻结的视觉基础模型(VFM)中间特征监督规划器编码器,推理时丢弃对齐模块,从而不改变规划器结构与推理成本;在 NAVSIM v2 与 HUGSIM 上,ViRA 让回归式、扩散式与评分式三类规划器一致获得驾驶性能提升,且增益取决于 VFM 目标选择与规划器是否使用辅助感知监督。

Source-provided article image: Do Better Visual Representations Always Lead to Better End-to-End Autonomous Driving?
Figure 1 ·

Figure 1: Better visual representations improve planning, with gains depending on both VFMs and planners. (a) ViRA aligns planner representations with a frozen VFM during training, leaving inference unchanged. (b) Segmentation and visual attention suggest improved representations. (c) Better visual representations improve planning, but the gains depend on the VFM target and planner.

arXiv

深度剖析

VFM 引导的视觉表征对齐在多种规划器上一致提升驾驶性能,并延伸到零样本闭环评测。 此前多数工作只研究单一规划器–VFM 配对,缺少跨配对系统比较;ViRA 以统一接口在回归式 TransFuser、扩散式 DiffusionDrive、评分式 Rap∗ 上做对照。 NAVSIM v2 navtest 上 EPDMS 分别提升 5.4、7.4、10.9 分;navhard 上 Rap∗ 从 32.8 升至 49.2(+16.4);零样本 HUGSIM 上三者整体 HD-Score 分别提升 2.7、6.4、3.0 分。

增益依赖预训练目标而非对齐损失本身的正则化作用。 用相同对齐目标替换为随机初始化目标作为对照,检验增益是否来自 VFM 预训练知识。 随机目标对齐使 TransFuser 的 BEV 分割 mIoU 从 36.4 降到 30.7,EPDMS 下降 1.6 分;Rap∗ 下降 1.7 分;而预训练 DVGT 目标使两者分别提升 5.4 与 10.9 分。

VFM 目标选择影响规划性能,且与规划器已有表征存在互补性。 固定规划器架构只更换对齐目标,量化目标选择带来的性能差异,并测试语义型与几何型 VFM 的互补。 无辅助感知监督的 Rap∗ 在五个目标上 EPDMS 跨度 5.5 分(79.4–84.9),DINOv3 增益最大;即使 Rap∗ 已用 DINOv3-L 骨干,再对齐几何型 VGGT 仍把 EPDMS 从 83.8 提到 86.3(+2.5)。

辅助感知监督降低规划器对 VFM 目标选择的敏感度,并主要补偿较弱目标。 在 TransFuser 上做有无辅助感知监督的受控对比,跨同一组五个 VFM 目标观察增益分布。 有辅助监督时 EPDMS 跨度仅 0.5 分(88.8–89.3),移除后扩大到 2.7 分(86.4–89.1);最高分几乎不变(89.3→89.1),最低分明显下降(88.8→86.4)。

启示与展望

该工作面向在仿真基准上训练与评测的端到端规划器:NAVSIM v2 navtest 覆盖 12,146 个真实场景,navhard 采用 244 个挑战性真实场景加 4,164 个 3D 高斯泼溅合成后续场景,HUGSIM 用于零样本闭环评测。ViRA 在训练时使用冻结 VFM 的中间表征作为表征级监督,推理时丢弃 VFM 与对齐头,因此部署架构与推理成本不变——DVGT 引导对齐在保持 20 ms 延迟与 69M 参数的同时把 EPDMS 从 72.8 提到 83.7,接近需 65 ms、351M 参数的 DINOv3-L 骨干替换(83.8)。这一设置适合希望在既有规划器上低成本引入预训练视觉知识的研究者与工程团队;作者也指出训练期提取与存储 VFM 表征可能带来额外训练开销,可通过特征缓存、轻量蒸馏或选择性对齐缓解。

读者仍需关注若干开放问题:结论建立在三个代表性规划器与仿真基准之上,作者明确表示未覆盖多模态传感器融合、视觉–语言–动作模型与实车部署,向更广规划器与真实数据的推广程度有待验证;训练期 VFM 表征的提取与存储成本尚未量化,特征缓存或选择性对齐的实际收益仍待评估;失败案例显示即使 BEV 语义图更完整,规划轨迹在挑战场景中仍可能偏离人类专家,说明表征质量并非充分条件,轨迹解码、时序推理、交互建模与不确定性下的决策仍是独立环节;此外 VFM 可能继承预训练数据中的地理、天气、文化与交通分布偏差,迁移到规划器后的影响需要跨环境评测与透明的失败分析。

来源