还记得上周那个在 OpenRouter 上匿名跑分、把 GPT-5.6 和 Claude 都碾了一遍的神秘模型吗?身份谜底揭晓了——就是智谱。
8 月 26 日晚,智谱正式上线并开源 GLM-5.3-Flash(320B-A18B),也就是此前匿名测试的 Ox-Alpha,中文社区爱称”牛来”。最炸裂的不是它打平了 Opus 4.8,而是:同样智力,1/40 的价格,而且这次智谱第一次让一个前沿模型全程跑在国产芯片集群上。
一、事实梳理:这个模型到底什么水平
先说参数和架构。GLM-5.3-Flash 总参数 320B,但每次只激活 18B(A18B,MoE 架构),45 层。作为对比,GLM-4.5 总参 355B、激活 32B、92 层——激活参数和层数几乎减半,但能力反而更强。
- 综合智能:AA(Artificial Analysis)综合智能指数 57 分,进入全球前沿区间,与 Claude Opus 4.8 持平
- 编程:自研 Z.ai Code Bench 上编程表现与 Opus 4.8 相当;DeepSWE v1.1 拿到 63.4(GLM-5.2 是 46.2)
- 多模态:GLM-5 系列首个原生多模态模型,视觉编码直接集成进模型,能自主判断何时”观察”、用视觉反馈指导下一步,适合前端开发、游戏、3D 仿真——智谱内部测试里,它在 Blender 里自主跑了 16 小时搭出一间约 400 平米的专业厨房
- 上下文:最高 100 万 token
- 办公能力:可检查优化 PPTX / PDF / DOCX / XLSX 输出,针对金融、法律场景优化,能做合同审查批注、律师函起草
架构上它还是首个采用”稀疏注意力 + 线性注意力”混合架构的开源前沿模型:相比 GLM-5.3,注意力计算量降约 3 倍、KV 缓存降约 4.4 倍,长上下文服务成本被大幅压下来——这正是它能卖低价的技术底座。
二、价格账:1/40 是什么概念
智谱官方给的定价口径是:GLM-5.3-Flash 是 GLM-5.3 的 1/10,限时折扣内是 1/20,按 AA 智能指数每任务成本算,只有 Claude Opus 4.8 的 1/40。
具体到 API 价格(每百万 token):
- 输入:0.15 美元;输出:0.50 美元;缓存命中输入:0.03 美元
- 国内价格:输入限时 0.4 元、输出 1.4 元,之后 2.8 元,缓存命中 0.115 元
这个价位比 DeepSeek-V4-Flash 还低一档,限时折扣甚至低于它的谷时价。放在”和 Opus 4.8 同档智力”的前提下来看,等于把前沿智能从”按量精打细算”变成了”随便造”。
有意思的是发布节奏:8 月 20 日它以匿名模型 Ox-Alpha 上线 OpenRouter 和 OpenCode,一周内成为当周最受欢迎模型,创下双平台调用量新高,OpenRouter 上 6 天处理超 20 万亿 token——而这一切流量,全程由国产芯片集群提供算力。智谱官方也确认,那周的免费测试是有意为之,就是来验证国产芯片大规模承载能力。
三、国产芯片这件事,比模型本身更重要
这可能是这轮发布里最被低估的信号。智谱说这是它首次在大规模流量中使用国产芯片集群:自研高带宽互联网络连接,在 SGLang 基础上构建专用推理引擎,端到端服务性能比初始基线提升 3 倍,硬件效率和单 token 成本已经和主流英伟达 GPU 相当。
在美国出口管制持续收紧、先进芯片买不到的背景下,这是国产大模型厂商第一次公开证明:”我们能用国产卡,把前沿模型的推理成本做到和国际主流 GPU 一个水平。”对算力自主可控这件事来说,GLM-5.3-Flash 的跑通,比多一个高分模型的意义大得多。
四、开发者怎么用
- 权重:MIT 协议,已在 Hugging Face 和 ModelScope 上线(FP8 / BF16 两种格式),可直接用 vLLM、SGLang、KTransformers 等框架自部署
- API:已开放调用,接入 ZCode 等编码平台,纳入 GLM Coding Plan(每天限量发放 1 万张体验卡,套餐用户额度提升到原来的 3 倍,体验卡也重置了)
- 老达提醒:之前社区传的”DeepSWE 80%”是 10 道题小样本的成绩,扩大样本后回落到约 63%,测试者已主动纠正。63 仍是第一梯队,但别拿那个 80% 当宣传语。
老达点评
这轮发布我最看重三点:
第一,“匿名跑分 → 真身揭晓”成了国产大模型的固定剧本。先匿名上线让社区自发测评、攒口碑,再官宣开源引爆——GLM-5.3-Flash 把营销和产品节奏玩明白了。对普通开发者来说,匿名期的真实用量数据(20 万亿 token)比任何发布会 PPT 都有说服力。
第二,1/40 的价格是冲着”开源生态 + 价格战”双杀去的。MIT 协议放权重,意味着任何人都能免费商用、自部署,这和 DeepSeek 的路线同向而行。国产大模型的竞争已经从”谁更强”变成”谁更便宜、谁更开放”,对开发者是实打实的红利——API 价格战,我们普通人真的是受益方。
第三,国产芯片首次扛住前沿模型的大规模流量,这是里程碑。它说明推理侧”去英伟达化”不只是口号,是真能落地跑起来的。虽然智谱的数据都是自报,具体效果还得等社区在真实负载下验证,但方向已经立住了。
给想试的人一句话:如果你已经在用 DeepSeek 或 GLM 的 API,去申请一张 GLM Coding Plan 体验卡,把编程场景切过去跑两天,感受一下”1/40 价格的 Opus 4.8″到底够不够用——反正不花钱。模型选型更多思路可以看我的 AI编程工具专题 和 老达AI实践专题。