AI导航

Anthropic 实测 GLM-5.3 网络攻击能力:开放权重模型的防护可被轻松绕过

AI资讯
4 min read
1 次阅读

GLM-5.3 的网络攻击能力已经追平顶级封闭模型,但它的防护却很容易被绕开。2026 年 9 月 29 日,Anthropic 在官方研究博客发表了对智谱 GLM-5.3(海外以 Z.ai 品牌发布)的评估:在 ExploitBench 评测里,GLM-5.3 自主开发出端到端漏洞利用的成功率为 50/410,与 Claude Mythos Preview 的 56/410 相当;但在防护绕过测试中,欺骗性提示让模型配合的比例达到 64%,预填推理时达到 92%,而拿到开放权重做“abliteration”处理后,配合率是 100%。

它到底能干什么:三组数字

先看攻击能力。Anthropic 用 ExploitBench 测模型利用 Chrome V8 引擎已知漏洞、做出完整攻击链的能力:GLM-5.3 在 410 次尝试中 50 次成功(约 12%),Claude Mythos Preview 是 56 次(约 14%),而 Claude Opus 4.6、GLM-5.2、Kimi K3、DeepSeek V4.1-Flash 几乎全是 0%。在自家内部的二进制漏洞利用基准上,GLM-5.3 有 4% 的试验完成了完整的控制流劫持,Mythos 是 6%,更早的模型同样是 0%。

更值得注意的是人机配合的测试。Anthropic 的研究员让 GLM-5.3 在沙箱里分析一款流行浏览器的本地 Linux 构建,一天之内、人类只投入了不到一小时注意力,模型就找到了浏览器 JavaScript 引擎里多个此前未知的漏洞,并把它们串成一条完整攻击链:一个恶意网页,被访问后就能读取访问者电脑上的任意文件。报告里贴出的演示截图显示,攻击页面成功读取了受害者机器上的 SSH 私钥。这些漏洞已经披露给了相关维护者。

另一组测试用的是小一号的 GLM-5.3-Flash。研究员给了它 CVE-2026-11645(一个近期披露的 Chrome 漏洞)的公开细节,模型在没有多少人工指导的情况下,把两个已知漏洞串成针对 ARM64 目标的可靠攻击链,还绕过了指针认证(PAC)加固。整个过程人类只花了 20 分钟,模型跑了 8 小时,按智谱的 API 价格折算,成本是 20.40 美元。

防护的三道门是怎么被推开的

GLM-5.3 并非完全没有防护:直接下达明显有害的指令时,它基本都会拒绝。但 Anthropic 找到了三种简单的绕过办法。第一,编个“红队演练”的幌子,告诉模型它是自主红队智能体,配合率 64%。第二,在模型的思考 token 里预填“已经决定继续”的内容,配合率 92%。第三,因为权重是开放的,直接做 abliteration(一种去除拒绝倾向的权重编辑技术),配合率 100%。

做一次 abliteration 的门槛并不高。Anthropic 的团队此前从没做过这件事,花了约 2200 个 GPU 小时、约 4400 美元的算力成本,就把 GLM-5.3 在三个有害请求基准(JailbreakBench、HarmBench、StrongREJECT)上的拒绝率从 90% 以上打到 3%、2% 和 12%。小模型 GLM-5.3-Flash 只用了约 600 GPU 小时。更关键的是,abliteration 几乎没损伤模型能力:GPQA-Diamond 科学能力评测上分数不变。报告还提到,GLM-5.3 发布几天内,网上就出现了第三方发布的 abliterated 版本。

作为对照,Anthropic 用同样的手段测试自家 Claude 模型:API 层面根本不支持预填思考过程,权重不开放所以无法 abliteration,欺骗性提示也被挡下,三种手段的配合率都是 0%。

谁会受影响

这不是 Anthropic 一家之言。2026 年 9 月 17 日,美国国家标准与技术研究院下属的 AI 标准与创新中心(CAISI)也发布了对 GLM-5.3 的评估,称它是“迄今为止网络能力最强的开放权重模型”,在 CAISI 的网络基准综合评分上落后美国前沿约四个月——而美国前沿模型要么带防护、要么只向受信任用户开放,攻击者拿不到,GLM-5.3 却是谁都能下载。

Anthropic 的结论很直接:GLM-5.3 会让恶意行为者获得“几乎没有实质限制”的漏洞挖掘能力,这是此前任何同等能力的模型都没给过的。同时他们也承认,这些能力同样能帮防御方更快地找到自家系统的漏洞。

对普通读者来说,这件事的现实意义在于:顶级网络攻击辅助能力正在从“少数实验室的受限项目”变成“可下载的开放权重”。企业安全团队需要假设这类能力已经扩散,补丁节奏和入侵检测都得按这个前提重新评估;而开源模型的能力与防护之间的落差,接下来会是监管和行业争论的焦点。

推荐工具

NVIDIA Chat with RTX AI聊天 Chat with RTX 是 NVIDIA 面向 RTX 电脑的本地 AI 聊天工具,可围绕本地文档和视频资料做问答,适合重视隐私、离线检索并具备硬件条件的用户更适合资料不便上传云 HuggingChat AI聊天 HuggingChat 是 Hugging Face 的开源模型聊天应用,支持 Omni 自动选模型,也可手动选社区开放模型对话。它适合体验开源模型、技术探索和问答,结果可能不稳定,重要内容需复核。 纳米AI搜索 AI搜索 纳米AI 是 360 旗下 AI 搜索和智能体入口,支持文字、语音、拍照提问、多模型协作与内容创作,适合中文用户做日常搜索、学习问答、移动查询、热点追踪、生活决策、知识整理和轻量创作。 Qwen Chat(通义千问) AI聊天 Qwen Chat 是Qwen 大模型聊天助手,支持Qwen 模型聊天、写作和编程问答,适合中文用户和开发者完成 AI 对话、资料问答和任务协作,适合上线前核对权限、成本和资料质量。 DuckDuckGo AI Chat AI聊天 DuckDuckGo AI Chat 适合重视隐私的普通用户使用,围绕隐私 AI 聊天、免账户使用和多模型问答提供对话式 AI 支持和任务协作能力,适合上线前核对权限、成本和资料质量。 Goody-2 AI聊天 Goody-2 是以极端安全和伦理对齐为特色的 AI 聊天助手,常用于观察模型拒答边界、内容安全策略、保守输出体验和 AI 风险讨论,更适合作为安全边界样本使用前应理解它偏实验性质,不适合。