Anthropic 红队评估 GLM-5.3:可自主构建端到端漏洞利用,且防护可被简单手法绕过 64%–100%
核心概要
Anthropic 前沿红队对智谱 AI(海外称 Z.ai)的 GLM-5.3 做了自动化基准与人工参与式评估,发现该模型能自主构建端到端网络漏洞利用(ExploitBench 上 410 次尝试中成功 50 次,内部二进制利用基准上 4% 的试验实现完整控制流劫持),并在模拟测试中可用简单手法在 64%–100% 的情况下绕过其安全防护,而同类手法对受防护的 Claude 模型未成功。
深度剖析
GLM-5.3 具备自主构建端到端网络漏洞利用的能力,接近 Claude Mythos Preview 的水平。 此前只有 Claude Mythos Preview 展示过这一能力,且是通过 Project Glasswing 限量发布;本文首次把同等量级的利用开发能力与一个公开可下载的开放权重模型对应起来。 在 ExploitBench(针对 Google Chrome 所用 V8 引擎的已知漏洞)上,GLM-5.3 在 410 次尝试中成功构建端到端利用 50 次,Claude Mythos Preview 为 56 次;在内部二进制利用基准的 100 个随机任务上,GLM-5.3 在 4% 的试验中实现完整控制流劫持,Claude Mythos Preview 为 6%,而更早的 Claude Opus 4.6 与 GLM-5.2 一次都未成功。
在人工参与的攻击性任务中,GLM-5.3 能在极短的人类投入下发现并串联此前未知的漏洞。 评估目标由人类专家事先不知存在漏洞,测试的是发现并利用新缺陷的开放式能力,而非复现已知问题。 一次会话中,研究者在一台沙箱机器上使用流行浏览器的本地 Linux 构建,GLM-5.3 在一天内、人类注意力有限的情况下找到该浏览器 JavaScript 引擎中若干此前未知的漏洞,并串联成一个可工作的利用:访问某网页即可读取访问者计算机上的任意文件;该会话还识别出无线与图形驱动、面向网络的设备软件等系统中的可利用漏洞。
GLM-5.3 的防护可被绕过或移除,且移除后能力几乎不下降。 本文不仅报告能力水平,还量化了防护被绕过的比例,并自行复现了开放权重模型特有的“消融”(abliteration)路径。 模拟测试中,简单手法可在 64%–100% 的情况下绕过 GLM-5.3 的防护,而这些手法在测试中未能让受防护的 Claude 模型执行有害任务;团队自行消融 GLM-5.3 约耗 2,200 GPU 小时、约 4,400 美元算力成本,GLM-5.3-Flash 约 600 GPU 小时,消融后拒答率从 90% 以上降至 JailbreakBench 约 3%、HarmBench 约 2%、StrongREJECT 12%,而 GPQA-Diamond 上标准版与消融版得分相同,CyberGym 测试子集上消融版低几个百分点。
把公开修复转化为可用攻击的成本极低。 展示了“N-day”漏洞利用的自动化程度:模型可在几乎没有人类指导的情况下把公开披露的修复细节变成可工作的攻击链。 研究者向 GLM-5.3-Flash 提供 Google Chrome 漏洞 CVE-2026-11645 及另一个已知漏洞的公开细节,模型在无显著人工指导下串联两者,为 ARM64 目标构建出可靠利用链并绕过指针认证(PAC)加固,耗时 20 分钟人类注意力加 8 小时模型工作,按智谱 API 价格约合 20.40 美元。
启示与展望
这项工作面向的是网络防御方、模型开发者与政策制定者:它说明在开放权重模型已具备端到端利用开发能力的情况下,防御方需要获得至少与对手同等水平的前沿模型,作者也提到正通过 Project Glasswing、Patch the Planet 等努力扩大受信任防御方的访问。评估本身在隔离沙箱中针对预设的离线目标进行,因此其结论适用于这些受控设置下的能力刻画,而非对真实攻击事件的记录。
读者仍需留意:本文的绕过成功率来自模拟测试,作者也说明这些手法在测试中未能让受防护的 Claude 模型执行有害任务,因此不同模型与部署方式下的表现可能不同;消融后的能力变化只在 GPQA-Diamond 与 CyberGym 的一个测试子集上测量;浏览器漏洞的影响范围作者认为可能扩展到其他平台,但称其利用路径可能更复杂,尚待确认;此外,文中提到的若干漏洞报告仍在审查中,尚未全部披露给维护者。
