arXiv 2026年10月5日MLCommons Jailbreak Benchmark v1.0 提出一套端到端方法,用 264 条覆盖十一个危害类别的种子提示和来自 MLCommons 越狱分类法的代表性攻击,对八个开放权重大语言模型进行配对基线与对抗评估,按 AILuminate 评估标准 v1.4 判定回复,并以韧性差距衡量鲁棒性;结果显示不安全回复率从基线 11.08% 升至越狱条件下的 18.65%,平均韧性差距 7.57%,可访问系统的平均差距更大,攻击有效性随攻击类别与危害类型差异明显。MLCommons Jailbreak Benchmark v1.0 提出一套端到端方法,用 264 条覆盖十一个危害类别的种子提示和来自 MLCommons 越狱分类法的代表性攻击,对八个开放权重大语言模型进行配对基线与对抗评估,按 AILuminate 评估标准 v1.4 判定回复,并以韧性差距衡量鲁棒性;结果显示不安全回复率从基线 11.08% 升至越狱条件下的 18.65%,平均韧性差距 7.57%,可访问系统的平均差距更大,攻击有效性随攻击类别与危害类型差异明显。MLCommons 发布 Jailbreak Benchmark v1.0:八个开放权重模型在越狱条件下不安全回复率从 11.08% 升至 18.65%,平均韧性差距 7.57%MLCommons Jailbreak Benchmark v1.0 提出一套端到端方法,用 264 条覆盖十一个危害类别的种子提示和来自 MLCommons 越狱分类法的代表性攻击,对八个开放权重大语言模型进行配对基线与对抗评估,按 AILuminate 评估标准 v1.4 判定回复,并以韧性差距衡量鲁棒性;结果显示不安全回复率从基线 11.08% 升至越狱条件下的 18.65%,平均韧性差距 7.57%,可访问系统的平均差距更大,攻击有效性随攻击类别与危害类型差异明显。MLCommons Jailbreak Benchmark v1.0 提出一套端到端方法,用 264 条覆盖十一个危害类别的种子提示和来自 MLCommons 越狱分类法的代表性攻击,对八个开放权重大语言模型进行配对基线与对抗评估,按 AILuminate 评估标准 v1.4 判定回复,并以韧性差距衡量鲁棒性;结果显示不安全回复率从基线 11.08% 升至越狱条件下的 18.65%,平均韧性差距 7.57%,可访问系统的平均差距更大,攻击有效性随攻击类别与危害类型差异明显。