智谱 GLM-5.3 上线:编程王座易主,还「意外」练出了网络安全能力

智谱 GLM-5.3 大模型主题插画,神经网络球体与开源锁链和网络安全盾牌交织的场景
内容摘要

智谱 8 月 14 日发布 GLM-5.3,基座没换、全靠后训练 Scaling,编程能力登顶开源第一,还意外涌现出网络安全能力,两个月里在 269 个开源项目挖出 2436 个漏洞。本文拆解这次升级强在哪、网络安全能力为什么值得警惕、对开发者和安全从业者的影响。

8 月 14 日,智谱发布了新一代模型 GLM-5.3。这本身不算新鲜——国产大模型的更新节奏早就从”月更”卷到了”周更”。真正让圈子里炸开锅的,是两件事:编程能力直接把”开源王座”抢了过来,以及一项谁也没提前预告的网络安全能力。

而且第二件事,连智谱自己都说”出乎意料”。

先看编程:不换底座,全靠”后训练”

GLM-5.3 最大的反直觉之处在于:它的基座模型跟 GLM-5.2 完全一样,一个字没改。所有的提升,都来自后训练(Post-Training)阶段的 Scaling。

这背后是智谱那套组合拳:IndexShare(长上下文技术)、SAO(长程任务强化学习)、以及开源的 Slime 框架(大规模异步 RL)。说白了,就是往训练里堆更多的算力、更丰富更拟真的任务环境,把模型在”真实干活”这件事上的上限硬往上顶。

结果确实顶出来了。几个关键基准的对比很直观:

  • Terminal-Bench 3.0:4.6 → 28.3,翻了六倍。这个测试考察模型在真实终端里完成复杂任务的能力。
  • DeepSWE v1.1:46.2 → 66.9,聚焦长程软件工程和持续改代码。
  • Agents’ Last Exam(CLI):23.8 → 28.5,覆盖跨工具协作的真实专业场景。

智谱自家还有个 Z.ai Code Bench,专门模拟”开发者实际用 Coding Agent”的体感,GLM-5.3 比前代提升了 50%。官方直接放话:这是目前排名最高的开源模型,编程和智能体能力接近 Claude 的 Fable 5,体感超过其他国产模型。

更让人意外的是网络安全能力

如果说编程是”按计划达成的进步”,那网络安全就是”跑偏出来的能力”。

智谱的说法是:他们在后训练里加入了一些漏洞发现的数据和环境,本意是让模型更擅长找单个 bug、推理漏洞成因。结果随着训练规模上来,能力一路”复利”,模型开始能跨多个阶段做利用链的编排——从”找漏洞”进化到了”策划完整的攻击路径”。

数据更吓人:

  • CyberGym(白盒代码漏洞识别):84.5%,高于 GLM-5.2 的 77.2%。
  • ExploitBench(真实漏洞利用推理):24.4% → 54.4%,直接翻倍还多。
  • ExploitGym(限时漏洞利用任务):两小时完成 105 个,六小时 130 个;前代分别是 29 和 39 个。

配套的现实数据是:智谱联合多家安全团队,用模型在 269 个开源项目里挖出了 2436 个漏洞,其中 1097 个是严重或高危级别,覆盖操作系统内核、浏览器引擎、网络协议等底层组件。很多漏洞沉睡了多年,最早的一个可以追溯到 1981 年。

目前只有 53 个漏洞公开披露并分配了 CVE,剩下 2383 个还在保密披露期(embargo)。智谱为此专门开了个公开的安全披露台账,跟踪每个漏洞的披露进度。

这对我们意味着什么

这件事的价值,得分两头看。

对安全从业者是利好。 一个能系统性地在真实项目里挖漏洞的开源模型,等于给白帽、安全团队配了一个不知疲倦的助手。过去挖漏洞靠人肉审计 + 半自动扫描,现在可以把模型当第一道筛查,人再去做复核和验证。智谱敢把数据摆到台面上、还建公开台账,至少在”负责任披露”这个动作上是到位的。

但双刃剑的另一面同样锋利。 同一个模型,白帽能用,黑帽也能用。开源权重两周后就要放出来,届时这套能力会落到所有人手里,包括没有道德包袱的人。ExploitBench 翻倍、ExploitGym 六倍多,这些数字意味着”漏洞利用”的门槛在肉眼可见地降低。

这跟一个月前 OpenAI Astra 那件事是同一个方向的信号:模型的安全能力正在从”防御辅助”走向”攻防两端都能干”。区别在于,Astra 是闭源的、被内部叫停的;GLM-5.3 是开源的、主动放出来的。

老达点评

老达的看法可能有点不讨喜,但得说:GLM-5.3 这次真正的看点,不是”又登了个顶”,而是它把”开源模型的攻防能力边界”这个问题,硬生生摆到了所有人面前。

过去聊 AI 安全,主流叙事是”模型别被越狱、别乱说”。GLM-5.3 提醒我们,安全能力本身也是一种能力,而且是会随着 Scaling 一起涨的能力。当挖漏洞、拼利用链可以被一个开源模型自动化,安全这个行业的工作方式,甚至攻防双方的权力平衡,都会被重写。

对普通开发者来说,这件事短期内没有直接影响,你该用 Claude Code 还是用 Codex 都不受影响。但如果你在安全、合规、或任何涉及”供应链安全”的岗位,GLM-5.3 值得你专门留一天去看看它的安全披露台账,感受一下这条线已经走到哪了。

智谱这次”不换底座只炼后训”的打法,本身也值得国产大模型同行琢磨——当基座趋同,后训练的质量,可能就是下一阶段拉开差距的地方。

相关阅读

这几篇可以连起来看,把国产大模型和 AI 安全的脉络串起来:

更多内容逛 AI 编程工具专题AI 智能体与自动化专题老达 AI 实践专题

发表评论

您的电子邮箱地址不会被公开,必填项已标注 *