Gemini 4 Argon 发布:输出拉到 100 万 token,18 项跑分赢 12 项,却先只给安全圈用

谷歌 Gemini 4 Argon 前沿模型发布示意图:一条被闸门限制的强光通道通向少数持证者
内容摘要

谷歌 9 月 30 日发布七个月来首个旗舰 Gemini 4 Argon:输出上限从 6.4 万拉到 100 万 token,试用价每百万输入 2 美元,官方称 18 项跑分赢下 12 项,但首批只开放给安全团队,独立榜单显示仍落后对手旗舰。本文拆清跑分口径、真实成本与开放时间,告诉你该不该等它。

谷歌憋了七个月,终于在 9 月 30 日放出新旗舰 Gemini 4 Argon。官方给出的数字很漂亮:18 项跑分赢下 12 项,输出上限从 6.4 万 token 拉到 100 万,试用价只有对手的一半。

但另一面同样醒目:首批能用的,只有 Fairwind 计划里的安全团队;独立榜单上,它的智能指数还落后 Claude Opus 5.5 一截。跑分第一和”能用上”之间,隔着一道闸门。 这也是老达在老达AI实践专题里反复提醒的那句话——看发布看的是热闹,看口径才看得出真假。

谷歌七个月没发旗舰,这次跳过了 3.5

Argon 由谷歌 DeepMind 官方发布。它是谷歌隔了七个多月才拿出的新旗舰——上一代还是 Gemini 3.1 Pro。更值得注意的是,早就预告过的 Gemini 3.5 被整个跳过,谷歌直接上 4。想回顾谷歌这条”小步快跑”的路线,可以看Gemini 3.8 Flash 的发布解读——当时它 6 周连推 3 款小模型,走的是完全相反的思路。

这也是 Gemini 家族第一个用代号命名的模型——不再叫 Pro、Flash、Flash-Lite。谷歌没说明后面几款 Gemini 4 会怎么命名。

技术上升级最大的其实是输出长度:上一代的输出上限 6.4 万 token,Argon 直接提到 100 万,输入上下文保持 100 万。为了让超长生成不中途超时,谷歌还加了一个 API 特性叫 Long Decode Continuation,可以把一次回答暂停、再在后续调用里接着续。

一句话理解:它不是”想得更多”,而是”一次能写得完更多”,针对的就是大型代码迁移这种活。

跑分:18 项赢 12 项,输的四项全在”终端里写代码”

谷歌自家对比表上,Argon 在 18 项基准里 12 项第一、1 项并列。挑几个关键的:

  • DeepSWE v1.1 长程软件工程:77.9%,高于 Claude Opus 5.5 的 74.2% 和 GPT-6 Astra 的 74.1%
  • AutomationBench 企业流程自动化:51.3%,第一
  • Harvey 法律智能体基准:19.6%,对比 Astra 的 5.4%、Fable 5.1 的 3.8%
  • CWE-bench v1 漏洞修复:68%,与 Astra 并列第一
  • LVBench 长视频理解:91.7%

但输的四项很集中,全是在终端或研究循环里做多步编程:

  • FrontierSWE v2:55.0%,Astra 65.5%
  • Terminal-Bench Science:57.6%,Astra 68.1%
  • Terminal-Bench 4.0:57.4%,Claude Opus 5.5 66.4%
  • PostTrainBench:45.3%,Astra 49.3%

差得不算小,9 到 10.5 个百分点。如果你主要用AI编程工具跑终端 Agent,这块短板值得留意。 谷歌之前在小模型上强,旗舰上”终端干活”一直是弱项,Argon 没完全补上。

独立榜单不给面子:智能指数落后 Opus 5.5

厂商自报的表格只能当参考。第三方这边,Artificial Analysis 给出的结论更有意思:

  • 高推理档智能指数 53 分(52.6 口径),和 GPT-6 Astra 打平,比 GPT-6.1 Sol 高 1 分
  • 但落后 Claude Opus 5.5(58 分)和 Claude Sonnet 5.5(56 分)
  • 相比 Gemini 3.1 Pro Preview,这是 23 分的大跃进

另一个独立榜单 Vals 把 Argon 排在 41 个模型里的第一,68.9%。两家打架,说明”第一”取决于用谁家的题。Bloomberg 还引述消息称,部分谷歌员工认为 Gemini 4 在跑分上强、在部分真实编码任务上偏弱,谷歌对此不认。

顺带说一句,这几家模型现在是互相咬着跑。想看上一轮的对比,可以翻OpenAI DevDay 2026 那篇,Astra 的定位、Sol 的降价都在里面;更早的同日降价分析则解释了为什么现在各家都爱打”每任务成本”这张牌。

便宜是便宜,但它话多

定价是 Argon 最直接的卖点:试用期每百万输入 token 2 美元、输出 10 美元,缓存输入再打 0.5 折;试用期结束后回到 4 美元和 20 美元——正好和 Claude Opus 5.5 同价。谷歌没有说试用期到什么时候结束。

这里有个容易被忽略的坑:Artificial Analysis 测出 Argon 每完成一个平均任务花 1.99 美元,是 GPT-6 Astra 的 60%;但同时它每个任务平均输出 6.2 万 token,Astra 只有 2.7 万。也就是说,单位价格的优势,有一部分被”话多”吃掉了。促销期一过,单任务成本回到约 3.98 美元。

还有一个反差:它的幻觉率只有 15%,远低于 Astra 的 51%,但准确率也是 50%,比 Astra 低 13 分。不乱说,但说的也没那么对——这一点比跑分更值得记住。

谷歌拿它改自己的内核:80 万行 C/C++ 转 Rust

谷歌这次少见的公开了内部用法,而且比跑分更有说服力:

  • 用 Argon 智能体把谷歌自己的 C/C++ 代码迁到 Rust,规模超过 80 万行,涉及 Fuchsia 系统的 Zircon 内核,以及 re2、libgav1 等核心库
  • 其中一个 Rust 版 libgav1 里,Argon 替掉了 3.2 万行 SIMD 代码,谷歌称同画质下比上一版 Rust 实现快 2.7 倍
  • 在数据中心里发现并应用内存优化,释放了超过 300 TiB 内存(估算区间 500 TiB 到 1 PiB)
  • 还有量子子程序相关优化,谷歌称把时空开销比公开基线降了 40%

安全侧也放了一个案例:Wiz 通过 Scan for Good 计划用 Argon 在医疗软件里找到一个高危漏洞,能让医院使用的系统暴露个人信息,而更早的前沿模型没发现。

这些仍是谷歌和合作方的内部口径,没有第三方审计,但”已经在改自家内核”这件事,比任何跑分都更能说明一款模型的工程能力。

现在谁能用、什么时候能用上

这是全文最实际的一段:

  • 现在能用:Fairwind 计划里的受信任安全团队,以及谷歌内部团队。给这批人时不带网络防护限制,好让它全力找漏洞
  • 接下来:付费 API 客户和 Google AI Ultra 订阅用户,谷歌只说”尽快”,没给日期
  • 发布当天:Argon 在 OpenRouter、Vertex AI、Gemini CLI、Cursor、GitHub Copilot 里都还查不到,工程团队迁移不了生产流量
  • 给公众前:谷歌列了四道安全闸,包括滥用与 CBRN 拒答、间接提示注入防护、思维链与行为错位监控等

跟谷歌上一款只在安全圈先跑的 Gemini 3.8 Flash Cyber 是同一套节奏:先给防守方,再给大众。

该不该等它:三类人的不同答案

按AI工具评测的老规矩,直接给判断:

可以重点评估——做大仓库代码迁移、需要超长单次输出的团队。100 万 token 输出上限目前是独一档。

先别急着换——重度依赖终端 Agent 的开发者。Terminal-Bench 4.0 落后 Opus 5.5 约 9 分,这块短期内 Claude 系更稳。

现在用不上——普通开发者和个人用户。API 没开、Cursor 和 Copilot 里也接不到,等它不如先把手上能用的模型用熟。

替代方案也很清楚:要长输出和代码迁移看 Argon;要终端 Agent 稳,用 Claude Opus 5.5 或 Sonnet 5.5;要极致便宜,GPT-6.1 Sol 每任务成本更狠;预算极紧又不需要超长输出,Gemini 3.8 系列仍是性价比选项。

老达点评

第一,“跑分第一”和”你我能用”是两件事。 谷歌这次把发布做成了准入制,先给安全圈再给大众,好处是把风险压住,代价是大多数开发者连试都试不了。宣传口径里的第一名,短期内跟你没关系。

第二,单位价格便宜不等于每件活便宜。 6.2 万 token 对 2.7 万 token 的输出差距,比单价差距更值得算。选模型要按”完成一个任务花多少钱”算,而不是按每百万 token 报价。

第三,看独立榜单要交叉验证。 Artificial Analysis 说它落后 Opus 5.5,Vals 说它是第一。两家都不算收钱办事,分歧只说明一个事实:跑分取决于出题人。谁的第一都别全信,自己拿真实任务测一遍才作数。

第四,这次最值钱的不是跑分,是”它已经在改谷歌自己的内核”。 80 万行 C/C++ 转 Rust、释放 300 TiB 内存,这些内部收益是可持续的,比发布会上的一张对比表更能说明方向。工具真正落地,从来不是因为它跑分高,而是因为它真的省了活。

发表评论

您的电子邮箱地址不会被公开,必填项已标注 *