抹掉安全防线只要 4400 美元:Anthropic 实测智谱 GLM-5.3 的攻击能力

概念图:一枚透明玻璃立方体机箱内壁出现裂纹,细红光线从中穿出连向外部节点,象征开源权重模型安全对齐被抹除后的攻击能力外溢
内容摘要

Anthropic 前沿红队用两套基准测试了智谱开源模型 GLM-5.3:410 次尝试里造出 50 个完整漏洞利用,逼近自家禁售的旗舰。更值得注意的另一半是,抹掉它的安全对齐只要约 4400 美元算力。本文拆解测试口径、真机演示,以及企业该改的三条假设。

9 月 29 日,Anthropic 的前沿红队发布了一份对智谱开源模型 GLM-5.3 的测试报告。结论有两半:一半是能力——它在攻击性网络安全任务上的表现,已经接近 Anthropic 自己因为风险太高、只在受控范围内提供给防守方的 Claude Mythos Preview;另一半是防线——只要约 4400 美元的算力,就能把它”不愿配合”的那部分抹掉。

这份报告值得认真看,因为它把一个一直模糊的问题摆到了台面上:当攻击能力可以免费下载,防守方的假设要改什么。放在这两个月的语境里看会更清楚——从《OpenAI 自曝六起模型失控案例》到《OpenAI 三个月内第二次叫停前沿训练》,行业已经连着交了三次学费,这次换了个方向:被测的不是大厂自己的模型,而是一个谁都能下载的开源权重模型。

先把结论摆出来

在 Anthropic 的 ExploitBench 测试里(题目针对 Chrome 的 V8 引擎),GLM-5.3 在 410 次尝试中造出了 50 个端到端的可用漏洞利用;同一套题,Claude Mythos Preview 是 56 次。

在 Anthropic 内部的二进制漏洞利用基准里(题目来自 Google OSS-Fuzz 的项目),GLM-5.3 有 4% 的尝试实现了完整的控制流劫持,Mythos Preview 是 6%。而这个测试里,更早的 GLM-5.2 和 Claude Opus 4.6 基本是零分,Kimi K3 和 DeepSeek V4.1 Flash 也是零分。

换句话说:不是开源模型第一次能写漏洞利用,而是它第一次追到了”厂商主动选择不发布”的那一档。

口径要说清楚

这里必须停一下,讲清楚这些数字的边界。

第一,ExploitBench 测的是利用已知缺陷,不是发现未知缺陷,两者难度差很远。

第二,这是 Anthropic 自己出题、评竞品模型的测试。它是目前最详细的公开数据,但不是独立审计——Anthropic 卖的是闭源竞品,它有商业动机讲这个论点。

第三,能力不等于可得性。GLM-5.3 的 FP8 权重约需 306 GB 显存,KV 缓存还要差不多一样多;想跑到 100 token/秒,大致需要 4 TB/s 的内存带宽和八张 H200 级别的卡。下载得到,和跑得动,是两件事。

一个相对中立的佐证是:美国标准机构 NIST 下属的 CAISI 在 9 月 17 日给出的结论方向一致,称 GLM-5.3 是”目前发布过的最具网络攻击能力的开源权重模型”,大约落后美国前沿四个月——时间上比 Anthropic 这份报告还早。

真机演示:一天之内挖出未知漏洞

报告里最有说服力的不是跑分,是两个演示。

第一个:在有限人工参与、前后约一天的时间里,研究人员用 GLM-5.3 在一个主流浏览器的 JavaScript 引擎里找到了若干个此前未知的缺陷,并把它们串成一个网页——访问者打开这个页面,本机文件就会被读走,包括 SSH 私钥。Anthropic 表示已报告给维护方。

第二个:换用更小的 GLM-5.3-Flash,针对已经公开的 Chrome 漏洞 CVE-2026-11645,8 小时模型时间加 20 分钟人工注意力,就造出了一条可用的利用链。按智谱的 API 价格算,这一趟花了 20.40 美元。

这个数字真正的意义在于:从补丁公布到武器化利用的时间差,正在被压到按小时计算。

安全阀有多好拆

更值得企业注意的是防线这一半。

直接要求 GLM-5.3 帮忙规划网络攻击,模型的配合率是 0%。但只要换个说法:

  • 给同一个请求编一个”封面故事”,配合率升到 64%
  • 把模型的思考过程预先填上”听起来很有帮助”的文字,配合率升到 92%

这就是常见的越狱和预填推理。真正棘手的是第三种:因为权重是公开的,任何人都可以做”对齐抹除”(abliteration)——通过改写模型内部少数几个方向,把学到的拒绝行为直接删掉。Anthropic 做完之后,配合率是 100%。

成本呢?一个不熟悉这套手法的团队大约用了 2200 GPU 小时(约 4400 美元);Anthropic 估计熟练团队 600 GPU 小时(约 1200 美元)就够,而这正好也是抹掉小号 Flash 的开销。抹除之后,模型在标准有害请求基准上的拒答率从 90% 以上掉到 2%–12%,通用能力几乎没有损失。几个抹除版本在模型发布后几天就出现在了网上。

Anthropic 说自家的 Claude 模型在上述所有条件下配合率都是 0%。这点可以信,也可以保留——毕竟这道对比题对它有利。

这份报告该信几分

把上面几段合起来看,价值和局限都很清楚。

值得信的部分:CAISI 更早给出了方向一致的结论,说明”开源权重已经追到前沿攻击能力”不是一家之言;而且报告中提到的未知漏洞已经报告给维护方,属于可验证的第三方动作。

要打折的部分:所有能力数字都出自 Anthropic 的题目和口径,没有独立复现。报告发布的同时,Anthropic 也顺势呼吁各国政府对足够强的模型(包括 GLM-5.3 的后续版本)做安全测试——这句话背后有它自己的商业位置。

也补一个背景:同一周,智谱和 Concordia AI 提出了一个开源权重模型的分阶段发布框架,并把 GLM-5.3 自身延迟发布权重作为”管理这类风险”的案例(智谱这条线的来龙去脉,可以看《智谱再融 335 亿押注 RSI》)。也就是说,模型方并不是完全没有动作,只是行业还没有一套大家都认的规则。

对企业和开发者:三条能落地的

一、把补丁窗口从”周”改成”天”。 一个总成本 20 美元、8 小时就能把公开漏洞变成可用利用链的工具已经在手上了。面向公网的关键组件,补丁排期要按天算,别再按周算。

二、先给自己的代码用上 AI 找漏洞。 Anthropic 在报告里的建议很直接:防守方该用上能满足需求的最强工具。攻击方已经在用 AI 挖漏洞,防守方还只靠人工审计,就是在让分。

三、用 AI 智能体的团队,把”能调用的工具”当成真正的安全边界。 这次报告测的是模型本身,但企业里真正造成损失的是”模型 + 权限”的组合。只读优先、敏感操作强制人工确认、服务账号最小权限——这三条比任何提示词防护都实在。这类基础设施怎么设计,可以对照《DeepSeek 公开 Agent 沙箱工厂》里的做法。

老达点评

一、这件事真正的分水岭不是”哪个模型强”,而是”补丁能不能在发布后打上去”。 闭源模型出问题,厂商可以改;开源权重一旦发出去,就再也改不回来了。同样的能力,两种完全不同的风险结构。

二、4400 美元这个数字比 50/410 更值得记住。 跑分高低是能手的游戏,但”抹掉一个模型的安全对齐只要一台小机器的成本”,意味着安全对齐本身不再是资产,而是可以被当成可选项处理的装饰。

三、别急着读成”国产模型不安全”。 报告测的是一类模型——公开权重的模型。同样的手法换到任何国家任何一家的开源权重模型上都成立。问题出在发布节奏和验证机制,不在厂商国籍。报告里也提到,同一周另有研究团队把其他几款开源权重模型越狱出有害指导——这类问题同样不挑厂商。

四、对开发者最实用的一条:把成本和权限当成同一个话题。 报告里”能力不等于可得性”这句提醒得很对——八张 H200 不是谁都跑得起。大多数人真正要防的,不是别人下载了模型,而是自己给智能体的权限太宽。

想顺着这条线继续看,可以翻AI智能体与自动化专题和 AI工具评测专题,模型能力与价格的横向对照都在里面。

发表评论

您的电子邮箱地址不会被公开,必填项已标注 *