跳到主要内容
返回时间线
arXiv来源发表:

ShieldVLA 用 Hamilton-Jacobi 可达性门控把 VLA 微调的安全代价平均降低 57%、成功率提升 0.13

核心概要

ShieldVLA 提出一种面向视觉-语言-动作(VLA)模型的安全对齐微调框架:它从视觉观测中无模型地学习 Hamilton-Jacobi 可达性安全价值函数作为安全评论家,用该评论家把策略优化门控为“可行区域内最大化奖励、接近不安全状态时转向恢复”,并以基于评分量规的 VLM 安全分数替代人工逐步代价标签,在五个导航与操作基准(Dubins-VL、TurtleBot-Nav、Safety-CHORES Nav/Fetch、Franka-Reach)上跨多个 VLA 主干,平均降低累计安全代价 57%、相对 SafeVLA 提升任务成功率 0.13。

AI-generated editorial illustration: ShieldVLA: Feasibility-Aware Safety Alignment for Vision-Language-Action Models

深度剖析

提出可行性门控的 VLA 安全微调框架:用无模型 Hamilton-Jacobi 可达性评论家判断当前状态是否仍可安全恢复,只在评论家判定不可行的状态上施加安全干预,从而取代 Lagrangian 方法的全局奖励-代价权衡。 此前 SafeVLA 等工作把安全作为对期望累计代价的软惩罚,缺少逐轨迹可行性信号;ShieldVLA 把安全从全局权衡改写为状态相关的可行性问题,并首次把 HJ 可达性用于基础模型的微调而非仅作运行时过滤器。 论文给出安全 Bellman 算子在无穷范数下为压缩映射的命题与证明(附录 A),并在 TurtleBot-Nav 上做门控与惩罚的对照消融:同一评论家下门控 SR 0.54 / CSC 6.90,Lagrangian 惩罚 SR 0.33 / CSC 7.80。

提出基于评分量规的 VLM 安全监督:把语义安全反馈经结构化量规与校准转成逐帧安全裕度,无需人工标注逐步代价标签。 自由形式的 VLM 判断噪声大、不稳定,难以支撑策略优化;该工作把 LLM/VLM-as-a-judge 与量规式奖励建模迁移到安全监督,用每回合二值安全标签做类平衡逻辑回归校准,并引入 Refinement-through-Differentiation 离线补足尾部失效模式。 在 TurtleBot-Nav 上,2B 评分器出现模式崩溃(AUROC 0.500),换用 8B 评分器并加入 RTD 新增量规后提升到 0.608;在 Safety-CHORES Nav 上 8B 的逐帧 AUROC 0.548、与 log(1+代价) 的 Spearman 相关 +0.272,高于 2B 的 +0.094。

在五个导航与操作基准、多个 VLA 主干上验证安全-性能权衡的改善,并在测试时视觉扰动下保持稳健。 评测覆盖 Dubins-VL、TurtleBot-Nav(OmniVLA)、Safety-CHORES Nav 与 Fetch(SPOC-VLA)、Franka-Reach(OpenVLA-OFT),并额外报告三种分布外视觉扰动(+Color、+Light、+All)下的表现,而不仅是分布内指标。 主表中 ShieldVLA 在多数环境同时取得最低碰撞率与最高成功率,例如 TurtleBot-Nav SR 0.54 / CSC 6.90 对 SafeVLA 的 0.34 / 14.6;3 个训练种子的标准差小于与 SafeVLA 点估计的差距;扰动下 ShieldVLA 在表 6 每个(环境,条件)单元保持最低 CSC。

消融显示收益来自可行性门控与连续校准代价信号,而非仅来自评论家本身。 把校准后的 VLM 量规裕度替换为二值碰撞指示后,评论家与门控不变,TurtleBot-Nav 成功率从 0.54 降到 0.31、Franka-Reach 从 0.45 降到 0.25,说明连续严重度信号是门控能选择性触发的前提。 二值代价消融在四个环境中的三个上使任务性能崩塌;门控对惩罚的对照在 TurtleBot-Nav 上两轴均占优。

启示与展望

该结果面向在模拟器中微调预训练 VLA 策略的研究与工程场景:Dubins-VL、TurtleBot-Nav、Safety-CHORES Nav/Fetch 与 Franka-Reach 覆盖轮式导航、移动操作与桌面操作,主干包括 OmniVLA、SPOC-VLA 与 OpenVLA-OFT。方法假设能获得每回合的二值安全标签用于校准,并假设回放数据中存在足够的近边界探索;VLM 评分只在训练期使用,测试期不调用。作者指出最直接的下一步是在真实机器人上验证(需要针对域偏移重新校准量规)以及扩大评分器规模以突破模式崩溃上限。

作者自述经典 HJ 压缩性在函数逼近与有限数据下不能直接迁移,因此所有安全结论都是经验性的;量规信号替代真值符号距离会引入第二重误差,学习到的安全集是量规信号诱导的安全集,与模拟器动力学之间的差距只在 Dubins-VL 上由 HJ(真值代价)一行给出界。评分器存在容量下限,低于 8B 的模型在尾部帧上出现模式崩溃;在极罕见不安全事件的环境中,门控阈值实际上退化为手工调参。对外比较只针对 SafeVLA 一个已发表基线,因为更早的安全强化学习方法缺少 VLA 实例。此外,本次读取的正文中部分数值(如摘要与结论中的平均降幅与成功率提升、表 3 的均值与标准差、表 4 与表 5 的部分单元格)在文本中缺失,只能依据外部报道给出的 57% 与 +0.13 以及正文中可读到的具体数字来归纳。

来源