Gemini 3.8 Flash 发布:谷歌 6 周连推 3 款小模型,终端跑分 90.8 逼近 Opus,还出了个 Cyber 版

Gemini 3.8 Flash 发布概念图,闪电形状的模型核心照亮终端编程窗口与盾牌图标,代表标准版与网络安全 Cyber 版双版本
内容摘要

谷歌发布 Gemini 3.8 Flash 与网络安全版 3.8 Flash Cyber:六周内第三款 Flash 模型,Terminal-Bench 2.1 跑分 90.8 逼近 Claude Opus 5,定价维持 0.75/3.75 美元并锁价到年底。一文看懂跑分、价格与 Agent 定位,帮你判断该不该换。

谷歌又发新模型了,这次的主角是 Flash 系列。9 月 2 日,Google DeepMind 正式上线 Gemini 3.8 Flash 和它的网络安全特化版 3.8 Flash Cyber——这是六周内谷歌推出的第三款 Flash 模型,频率快得像是开了”周更”模式。

比起上一代,这次最扎眼的数字是:Terminal-Bench 2.1 跑分 90.8,比 3.7 Flash 的 81.6 直接涨了 9 分多,官方称这是”Flash 系列对旗舰模型差距最小的一次”。

一、跑分到底涨了多少

先看官方给出的三组关键数据:

  • Terminal-Bench 2.1:90.8 分。这是模拟真实终端环境、让模型自主完成跨文件改代码、排错、执行多步指令的测试,最能反映 AI Agent 干活的真实水平。上一代 3.7 Flash 是 81.6 分,一次提升 9.2 个百分点。
  • DeepSWE v1.1(长周期软件工程):71 分。官方对比里,Claude Opus 5 是 74 分——差距从过去的两位数缩小到 3 分以内。这是 Flash 系列历史上最接近旗舰的一次。
  • HLE-Verified:54.9%。在涵盖 STEM、人文、专业领域的多步推理测试上,它超过了多数更贵的旗舰模型。

不止编程。谷歌还提到,在 Vals Finance Agent V2 和 Harvey 法律 Agent 基准上,3.8 Flash 也超过了 3.7 和部分旗舰。翻译成大白话:这代 Flash 不是只会在终端里写代码,而是把”自主干活”这件事整体往上拉了一档。

二、3.8 Flash Cyber 是什么来头

这次发布还有个特别版本——Gemini 3.8 Flash Cyber,专攻网络安全:漏洞检测、自动修补这类防御性任务。

和之前的安全模型不同,Cyber 版不直接公开开放,而是通过谷歌新成立的 Fairwind Program 定向提供,只给经过审核的”可信防御方”:政府机构、关键基础设施运营者、软件维护者。两款模型底层共享同一套基础智能,只是 Cyber 版在安全推理上做了强化训练。

有意思的是,谷歌在公告里明确说,这轮能力提升的一部分来自”在网络安全这种高要求领域的严格训练”——拿安全攻防当磨刀石,磨出来的是通用推理能力。这跟智谱、Anthropic 先做安全再做通用的思路殊途同归。

三、价格没涨,反而锁价到年底

开发者最关心的价格:输入 0.75 美元/百万 token,输出 3.75 美元/百万 token,和 3.7 Flash 完全一样,而且谷歌承诺这个价格锁到 2026 年 12 月 31 日,明年才调整到 1.50/7.50 美元。

API 代号是 gemini-3.8-flash,今天就能在 Google AI Studio、Gemini API、Gemini Enterprise Agent Platform 上直接用;普通用户则在 Gemini App(AI Pro/Ultra 订阅)、AI Mode 搜索、Google Sheets 的 Gemini 功能里陆续见到它。

我上一个判断还是那句话:2026 年下半年的竞争主线就是”性价比 Agent 模型”。OpenAI 给旗舰降价、DeepSeek 周末半价GLM-5.3-Flash 用 1/40 价格打平 Opus,现在谷歌用”加量不加价”的方式把 Flash 线焊死在性价比第一梯队。价格战没有停,只是从旗舰转移到了 Agent 干活的主力模型上。

四、Flash 高频迭代背后,是谷歌的焦虑

六周三连发,节奏快到不像是传统意义上的”大模型发布”。这背后其实是一步战略棋:

谷歌的 Pro 旗舰线最近不太好过。内部 3.5 Pro 的候选模型因为相对 Flash 提升不够显著被砍掉,下一代旗舰 Gemini 4 还在后训练阶段没完工。旗舰青黄不接的时候,Flash 线就成了谷歌 AI 的”门面”——用高频迭代 + 便宜价格,先把编程和 Agent 场景的用户圈住

之前站内聊谷歌补课两个月的 Gemini 3.5 Pro时我就说过,谷歌在编程能力上被 Anthropic 和 OpenAI 压着打。现在看,谷歌选择的突围路线很明确:不跟你在”最强旗舰”上硬拼,而是用 Flash 的迭代速度打消耗战——你一年发一款旗舰,我一年发五款小模型,每一款都逼近你的旗舰 90% 的能力、十分之一的价格。

这套打法能不能赢还不好说,但对开发者绝对是好事。

五、老达点评

这次发布给我的三个判断:

1. 90 分俱乐部里,”便宜好用”终于不是伪命题。 Terminal-Bench 90.8 这个数字意味着:跑真实终端 Agent 任务,3.8 Flash 已经摸到了 Opus 5 那批贵价模型的门槛。对绝大多数写工具、跑自动化、做 Agent 的开发者,旗舰多出的那几分能力,撑不起几十倍的差价。如果你正在做长周期编程 Agent,3.8 Flash 值得今天就去 AI Studio 试一轮。

2. “模型要更努力”正在变成设计哲学。 官方原话是 3.8 Flash “works harder”——复杂任务会多跑推理步骤、多迭代调用工具,哪怕多花点 token。这等于把”深度思考”做成了模型的可调档位:要高表现就调高 effort,要省成本就调低。这比单纯堆参数聪明,因为它把”用多少钱”的选择权还给了开发者。

3. 谷歌在赌 Agent 是下一个入口。 Flash 高频迭代 + Cyber 版 + Antigravity 这类 Agent 工具同步开源,说明谷歌的算盘是:让 Flash 成为 Agent 默认底座,渗透进搜索、移动端和十亿用户的日常。对做 Agent 应用的人来说,多一个便宜且能打的选择,议价空间就多一分。

想横向对比各家编程模型的跑分和价格,可以翻翻AI编程工具专题;如果关心 Gemini 在 Agent 工作流里的实际表现,AI智能体与自动化专题也攒了几篇实测。今天先试跑分,好用不好用,跑几个真实任务才知道——这个话题我会继续盯,有新的实测结果再来汇报。

发表评论

您的电子邮箱地址不会被公开,必填项已标注 *