谷歌又发新模型了,这次的主角是 Flash 系列。9 月 2 日,Google DeepMind 正式上线 Gemini 3.8 Flash 和它的网络安全特化版 3.8 Flash Cyber——这是六周内谷歌推出的第三款 Flash 模型,频率快得像是开了”周更”模式。
比起上一代,这次最扎眼的数字是:Terminal-Bench 2.1 跑分 90.8,比 3.7 Flash 的 81.6 直接涨了 9 分多,官方称这是”Flash 系列对旗舰模型差距最小的一次”。
一、跑分到底涨了多少
先看官方给出的三组关键数据:
- Terminal-Bench 2.1:90.8 分。这是模拟真实终端环境、让模型自主完成跨文件改代码、排错、执行多步指令的测试,最能反映 AI Agent 干活的真实水平。上一代 3.7 Flash 是 81.6 分,一次提升 9.2 个百分点。
- DeepSWE v1.1(长周期软件工程):71 分。官方对比里,Claude Opus 5 是 74 分——差距从过去的两位数缩小到 3 分以内。这是 Flash 系列历史上最接近旗舰的一次。
- HLE-Verified:54.9%。在涵盖 STEM、人文、专业领域的多步推理测试上,它超过了多数更贵的旗舰模型。
不止编程。谷歌还提到,在 Vals Finance Agent V2 和 Harvey 法律 Agent 基准上,3.8 Flash 也超过了 3.7 和部分旗舰。翻译成大白话:这代 Flash 不是只会在终端里写代码,而是把”自主干活”这件事整体往上拉了一档。
二、3.8 Flash Cyber 是什么来头
这次发布还有个特别版本——Gemini 3.8 Flash Cyber,专攻网络安全:漏洞检测、自动修补这类防御性任务。
和之前的安全模型不同,Cyber 版不直接公开开放,而是通过谷歌新成立的 Fairwind Program 定向提供,只给经过审核的”可信防御方”:政府机构、关键基础设施运营者、软件维护者。两款模型底层共享同一套基础智能,只是 Cyber 版在安全推理上做了强化训练。
有意思的是,谷歌在公告里明确说,这轮能力提升的一部分来自”在网络安全这种高要求领域的严格训练”——拿安全攻防当磨刀石,磨出来的是通用推理能力。这跟智谱、Anthropic 先做安全再做通用的思路殊途同归。
三、价格没涨,反而锁价到年底
开发者最关心的价格:输入 0.75 美元/百万 token,输出 3.75 美元/百万 token,和 3.7 Flash 完全一样,而且谷歌承诺这个价格锁到 2026 年 12 月 31 日,明年才调整到 1.50/7.50 美元。
API 代号是 gemini-3.8-flash,今天就能在 Google AI Studio、Gemini API、Gemini Enterprise Agent Platform 上直接用;普通用户则在 Gemini App(AI Pro/Ultra 订阅)、AI Mode 搜索、Google Sheets 的 Gemini 功能里陆续见到它。
我上一个判断还是那句话:2026 年下半年的竞争主线就是”性价比 Agent 模型”。OpenAI 给旗舰降价、DeepSeek 周末半价、GLM-5.3-Flash 用 1/40 价格打平 Opus,现在谷歌用”加量不加价”的方式把 Flash 线焊死在性价比第一梯队。价格战没有停,只是从旗舰转移到了 Agent 干活的主力模型上。
四、Flash 高频迭代背后,是谷歌的焦虑
六周三连发,节奏快到不像是传统意义上的”大模型发布”。这背后其实是一步战略棋:
谷歌的 Pro 旗舰线最近不太好过。内部 3.5 Pro 的候选模型因为相对 Flash 提升不够显著被砍掉,下一代旗舰 Gemini 4 还在后训练阶段没完工。旗舰青黄不接的时候,Flash 线就成了谷歌 AI 的”门面”——用高频迭代 + 便宜价格,先把编程和 Agent 场景的用户圈住。
之前站内聊谷歌补课两个月的 Gemini 3.5 Pro时我就说过,谷歌在编程能力上被 Anthropic 和 OpenAI 压着打。现在看,谷歌选择的突围路线很明确:不跟你在”最强旗舰”上硬拼,而是用 Flash 的迭代速度打消耗战——你一年发一款旗舰,我一年发五款小模型,每一款都逼近你的旗舰 90% 的能力、十分之一的价格。
这套打法能不能赢还不好说,但对开发者绝对是好事。
五、老达点评
这次发布给我的三个判断:
1. 90 分俱乐部里,”便宜好用”终于不是伪命题。 Terminal-Bench 90.8 这个数字意味着:跑真实终端 Agent 任务,3.8 Flash 已经摸到了 Opus 5 那批贵价模型的门槛。对绝大多数写工具、跑自动化、做 Agent 的开发者,旗舰多出的那几分能力,撑不起几十倍的差价。如果你正在做长周期编程 Agent,3.8 Flash 值得今天就去 AI Studio 试一轮。
2. “模型要更努力”正在变成设计哲学。 官方原话是 3.8 Flash “works harder”——复杂任务会多跑推理步骤、多迭代调用工具,哪怕多花点 token。这等于把”深度思考”做成了模型的可调档位:要高表现就调高 effort,要省成本就调低。这比单纯堆参数聪明,因为它把”用多少钱”的选择权还给了开发者。
3. 谷歌在赌 Agent 是下一个入口。 Flash 高频迭代 + Cyber 版 + Antigravity 这类 Agent 工具同步开源,说明谷歌的算盘是:让 Flash 成为 Agent 默认底座,渗透进搜索、移动端和十亿用户的日常。对做 Agent 应用的人来说,多一个便宜且能打的选择,议价空间就多一分。
想横向对比各家编程模型的跑分和价格,可以翻翻AI编程工具专题;如果关心 Gemini 在 Agent 工作流里的实际表现,AI智能体与自动化专题也攒了几篇实测。今天先试跑分,好用不好用,跑几个真实任务才知道——这个话题我会继续盯,有新的实测结果再来汇报。