DeepSeek V4 Flash 正式版上线,AI API 价格战全面开打:开发者该怎么选?

DeepSeek V4 Flash 与 OpenAI 等 AI 模型 API 价格战对比图表,展示开发者选型决策场景
内容摘要

DeepSeek V4 Flash 正式版 Agent 能力暴涨,OpenAI 同日降价 80%,多模型价格战进入新阶段。本文梳理各家最新定价、缓存策略和实际成本,帮你算清账、选对模型。

7 月 31 日,AI 圈连续两个大动作:DeepSeek 发布 V4 Flash 正式版,Agent 能力暴涨;同一天,OpenAI 宣布 GPT-5.6 系列降价,其中 Luna 模型价格直降 80%。

这不是巧合,而是一场酝酿已久的 API 价格战全面升级。对于用 AI 做产品的开发者来说,这既是省钱的机会,也是选择困难症的来源。下面把各家最新的价格、缓存策略和选型逻辑捋清楚。

DeepSeek V4 Flash 正式版:Agent 能力翻倍,价格没涨

这次 V4 Flash 正式版不是简单换个版本号。根据 Artificial Analysis 的评测数据,V4 Flash 正式版智能指数从 40 分跳到 50 分,比 4 月发布的 Flash 预览版高出 10 分,距离 GPT-5.6 Luna 的 51 分只差 1 分。

几个关键变化:

  • Agent 能力大幅提升。正式版在多步任务执行、工具调用和自我纠错上比预览版有明显的进步。有开发者反馈:”很清晰的、有边界的任务可���放心交给他干。”
  • 原生支持 Responses API。可以直接在 Codex CLI、VS Code Codex 插件和 ChatGPT 桌面端中调用 DeepSeek 模型,不需要额外适配层。对已经在用 Codex 生态的开发者来说,替换成本极低。
  • 价格不变。缓存命中输入 $0.0028/百万 token,缓存未命中输入 $0.14/百万 token,输出 $0.28/百万 token。拿 Claude Sonnet 5 的 $3/$15 来比,Flash 的价格大约是 Claude 的 1/90。
  • 长上下文效率优化。100 万 token 场景下,单 token 推理计算量仅为 V3.2 的 27%,KV Cache 占用降到约 10%。这意味着长链路任务(比如读整个代码仓库做重构)的实际成本远低于同等上下文长度的其他模型。

需要注意的是,DeepSeek 已预告将在北京时间的 09:00-12:00 和 14:00-18:00 高峰期实行 2 倍计费。虽然生效日期还没定,但如果你有大量定时任务,最好提前规划好避开高峰时段。

OpenAI 的反击:Luna 降 80%,模型分层更清晰

OpenAI 这次降价力度最大的就是 GPT-5.6 Luna:输入从 $1/百万 token 降到 $0.20,输出从 $6 降到 $1.20。

更新后的 GPT-5.6 家族定价:

  • Sol(旗舰):$5/$30,最大上下文 1.05M,适合复杂推理和高风险任务
  • Terra(中档):$2/$12,降了 20%,适合日常编程和文档处理
  • Luna(轻量)���$0.20/$1.20,降了 80%,适合分类、提取、搜索分诊等高频低复杂度任务

Luna 的输入价格现在只比 DeepSeek V4 Flash 贵 43%,但它有 1.05M 上下文窗口,而且可以直接用 OpenAI 的 Batch API 做异步批处理,再省一半。如果你的任务复杂度不高、但需要大上下文窗口,Luna 可能是更均衡的选择。

缓存才是真正的省钱密码

只看输入/输出价格还不够,缓存折扣才是决定实际成本的关键。

对于跑 Agent、做多轮对话、反复调用同一批文档的场景,缓存命中率直接影响账单:

  • DeepSeek V4 Flash:缓存命中输入 $0.0028/百万 token,仅为缓存未命中的 2%。这是目前业界最大的缓存折扣。
  • OpenAI GPT-5.6:缓存读取为输入的 10%,但缓存写入要收 1.25 倍输入费。
  • Anthropic Claude:缓存读取为输入的 10%,5 分钟和 1 小时写入分别收 1.25x 和 2x。
  • Google Gemini 3.6 Flash:缓存输入 $0.15/百万 token,缓存命中后成本大幅下降。

说得更直白一点:如果你在跑一个每次都要读同一份知识库的 Agent,用 DeepSeek 把输入做缓存后,每次查询的实际成本几乎可以忽略不计。而用 Claude 的话,缓存写入本身就要多花钱。

Sonnet 5 的临时价与 Kimi K3 的涨价:价格战的另一面

不是所有模型都在降价。

Anthropic 的 Claude Sonnet 5 目前是 $2/$10 的介绍价,9 月 1 日起将恢复为 $3/$15。这是个典型的”先用低价吸引你接入,然后回归常态”策略。

Kimi K3 刚完成 35 亿美元融资、估值冲到 350 亿美元,但价格反而涨了:非缓存输入 $3/百万 token,输出 $15/百万 token。跟 K2.6 比涨了不少。这说明头部模型在性能突破后,有底气维持高定价。

Mistral Small 4 更夸张:从 $0.10/$0.30 涨到 $0.15/$0.60,输入涨 50%、输出翻倍。

老达点评:别只看单价,算总账

价格战看着热闹,但开发者真正要做的是「算总账」,不是比谁便宜。

第一,算「每次成功任务」的成本,而不是每 token 的单价。便宜的模型如果输出质量差、需要反复重试,或者需要更长的推理链路,实际花费可能比贵的模型还高。比如让代码跑通这件事,Claude 一次过的成功率高于大部分低价模型,多花几毛钱但省下几轮调试时间,其实是赚的。

第二,看缓存命中率。如果你做的是重复性高的任务(比如文章分类、代码审查、问答系统),缓存是你最大的省钱工具。DeepSeek 在这块的折扣力度无人能及,而 OpenAI 的缓存策略更适合一次性查询场景。

第三,不要只绑一家。现在最划算的策略是「多模型路由」:简单任务走 Luna 或 Flash,复杂任务走 Sol 或 Sonnet,异步批处理走 Batch API。每个月根据实际账单调整比例。

第四,关注时间窗口。DeepSeek 的高峰期 2 倍计费虽然还没生效,但已经在路上了。如果你有定时跑的任务,趁现在把调度时间改到凌晨或下午 6 点后,别等生效了再手忙脚乱。

一句话总结:2026 年 8 月的 AI API 市场,便宜已经不是卖点,而是标配。真正的竞争力在于:谁能用最低的「每次有效任务成本」交付稳定的结果。

相关阅读:

发表评论

您的电子邮箱地址不会被公开,必填项已标注 *