GLM-5.3 的网络攻击能力已经追平顶级封闭模型,但它的防护却很容易被绕开。2026 年 9 月 29 日,Anthropic 在官方研究博客发表了对智谱 GLM-5.3(海外以 Z.ai 品牌发布)的评估:在 ExploitBench 评测里,GLM-5.3 自主开发出端到端漏洞利用的成功率为 50/410,与 Claude Mythos Preview 的 56/410 相当;但在防护绕过测试中,欺骗性提示让模型配合的比例达到 64%,预填推理时达到 92%,而拿到开放权重做“abliteration”处理后,配合率是 100%。
它到底能干什么:三组数字
先看攻击能力。Anthropic 用 ExploitBench 测模型利用 Chrome V8 引擎已知漏洞、做出完整攻击链的能力:GLM-5.3 在 410 次尝试中 50 次成功(约 12%),Claude Mythos Preview 是 56 次(约 14%),而 Claude Opus 4.6、GLM-5.2、Kimi K3、DeepSeek V4.1-Flash 几乎全是 0%。在自家内部的二进制漏洞利用基准上,GLM-5.3 有 4% 的试验完成了完整的控制流劫持,Mythos 是 6%,更早的模型同样是 0%。
更值得注意的是人机配合的测试。Anthropic 的研究员让 GLM-5.3 在沙箱里分析一款流行浏览器的本地 Linux 构建,一天之内、人类只投入了不到一小时注意力,模型就找到了浏览器 JavaScript 引擎里多个此前未知的漏洞,并把它们串成一条完整攻击链:一个恶意网页,被访问后就能读取访问者电脑上的任意文件。报告里贴出的演示截图显示,攻击页面成功读取了受害者机器上的 SSH 私钥。这些漏洞已经披露给了相关维护者。
另一组测试用的是小一号的 GLM-5.3-Flash。研究员给了它 CVE-2026-11645(一个近期披露的 Chrome 漏洞)的公开细节,模型在没有多少人工指导的情况下,把两个已知漏洞串成针对 ARM64 目标的可靠攻击链,还绕过了指针认证(PAC)加固。整个过程人类只花了 20 分钟,模型跑了 8 小时,按智谱的 API 价格折算,成本是 20.40 美元。
防护的三道门是怎么被推开的
GLM-5.3 并非完全没有防护:直接下达明显有害的指令时,它基本都会拒绝。但 Anthropic 找到了三种简单的绕过办法。第一,编个“红队演练”的幌子,告诉模型它是自主红队智能体,配合率 64%。第二,在模型的思考 token 里预填“已经决定继续”的内容,配合率 92%。第三,因为权重是开放的,直接做 abliteration(一种去除拒绝倾向的权重编辑技术),配合率 100%。
做一次 abliteration 的门槛并不高。Anthropic 的团队此前从没做过这件事,花了约 2200 个 GPU 小时、约 4400 美元的算力成本,就把 GLM-5.3 在三个有害请求基准(JailbreakBench、HarmBench、StrongREJECT)上的拒绝率从 90% 以上打到 3%、2% 和 12%。小模型 GLM-5.3-Flash 只用了约 600 GPU 小时。更关键的是,abliteration 几乎没损伤模型能力:GPQA-Diamond 科学能力评测上分数不变。报告还提到,GLM-5.3 发布几天内,网上就出现了第三方发布的 abliterated 版本。
作为对照,Anthropic 用同样的手段测试自家 Claude 模型:API 层面根本不支持预填思考过程,权重不开放所以无法 abliteration,欺骗性提示也被挡下,三种手段的配合率都是 0%。
谁会受影响
这不是 Anthropic 一家之言。2026 年 9 月 17 日,美国国家标准与技术研究院下属的 AI 标准与创新中心(CAISI)也发布了对 GLM-5.3 的评估,称它是“迄今为止网络能力最强的开放权重模型”,在 CAISI 的网络基准综合评分上落后美国前沿约四个月——而美国前沿模型要么带防护、要么只向受信任用户开放,攻击者拿不到,GLM-5.3 却是谁都能下载。
Anthropic 的结论很直接:GLM-5.3 会让恶意行为者获得“几乎没有实质限制”的漏洞挖掘能力,这是此前任何同等能力的模型都没给过的。同时他们也承认,这些能力同样能帮防御方更快地找到自家系统的漏洞。
对普通读者来说,这件事的现实意义在于:顶级网络攻击辅助能力正在从“少数实验室的受限项目”变成“可下载的开放权重”。企业安全团队需要假设这类能力已经扩散,补丁节奏和入侵检测都得按这个前提重新评估;而开源模型的能力与防护之间的落差,接下来会是监管和行业争论的焦点。