SLLCP 将冻结视觉语言模型的安全预测校准为预测集,在 15k CARLA 轨迹上把碰撞轨迹识别率从 4.6% 和 39.1% 提升到 89.6% 和 88.4%
相关研究与后续进展核心概要
作者提出 Split Label-Localized Conformal Prediction(SLLCP),一种作用于冻结视觉语言模型之上的事后校准层,把不可靠的预测转化为概率校准的安全预测集,并在交换性假设下给出标签条件有限样本无分布覆盖保证;在来自未见场景的 15k 条 CARLA 轨迹上,SLLCP 以 Qwen 为骨干正确标记 89.6% 的致碰撞轨迹、以 Cosmos 为骨干标记 88.4%,而基础视觉语言模型分别只标记 4.6% 和 39.1%。
Fig. 1: Uncertainty in VLM-based trajectory safety predictions ( safe or unsafe ) varies across driving scenes. SLLCP upweights calibration examples (bottom) near each test input (top) in the projected embedding space and calibrates each safety label separately to address class imbalance in the collected data (e.g., due to unsafe cases being rarer). Trajectory footprints are shown in blue, with yellow waypoints spaced at 0.5 0.5\, s intervals.
arXiv深度剖析
提出 SLLCP,一种在冻结视觉语言模型之上进行事后校准的共形预测层,将模型对驾驶轨迹安全性的近似预测转换为概率校准的安全预测集。 既有经典方法受限于其预测模型的质量,而视觉语言模型虽能推理高层动作后果,其近似预测不适合自动驾驶这类安全关键应用;SLLCP 不重新训练模型,而是在其输出之上做数据驱动的校准。 摘要说明该层为 post-hoc 校准层,作用于 frozen VLM,并称其输出为 probabilistically calibrated safety prediction sets;未给出实现细节。
引入局部化程序,在计算不确定性阈值时对与当前观测驾驶场景相关的过往经验加权,以反映安全估计能力可能依赖具体场景这一事实。 把场景依赖性显式纳入阈值计算,而非对所有场景使用统一阈值。 摘要以 localized procedure 与 upweights relevant past experience 描述该机制;未给出加权方式或场景划分标准。
在交换性假设下提供标签条件的有限样本无分布覆盖保证。 为该方法给出理论覆盖性质,而非仅报告经验性能。 摘要明确表述为 label-conditional finite-sample distribution-free coverage under exchangeability;未给出定理编号或证明细节。
在来自未见场景的 15k 条 CARLA 轨迹上,SLLCP 以 Qwen 为骨干正确标记 89.6% 的致碰撞轨迹、以 Cosmos 为骨干标记 88.4%,而基础视觉语言模型分别只标记 4.6% 和 39.1%。 相对基础视觉语言模型,漏报的致碰撞轨迹大幅减少,且两个不同骨干上均观察到该效果。 摘要报告了 15k 条 CARLA 轨迹、未见场景、两个骨干的对比数字;未报告误报率、阈值设置或统计不确定性。
启示与展望
该工作面向自动驾驶中规划轨迹的安全监测,适用于以视觉语言模型作为安全预测来源、并希望在不重新训练模型的前提下获得校准预测集的场景;其局部化程序针对安全估计能力随观测驾驶场景变化的情形,覆盖保证在交换性假设下成立。摘要显示该方法已在两个不同骨干(Qwen、Cosmos)上验证,说明其作为事后层的骨干可替换性;评估环境为 CARLA 轨迹与致碰撞标记任务。
摘要未报告误报率、预测集大小、阈值设置、场景划分方式以及 15k 条轨迹的构成,因此无法判断校准在漏报与误报之间的取舍;覆盖保证依赖交换性假设,而未见场景评估与交换性之间的关系在摘要中未展开;两个骨干的基线差异较大(4.6% 与 39.1%),其来源在摘要中未说明。以上均为摘要层面尚未回答的问题。
