DeepSeek V4.1 Flash 发布:552B 只激活 8B,KV 缓存砍到 1/4,V4 Pro 就此下线

DeepSeek V4.1 Flash 概念图:552B 参数 MoE 网络只点亮少量节点,KV 缓存被压缩成小方块,旁边是 API 终端与百万 token 上下文示意
内容摘要

DeepSeek 发布 V4.1 Flash:552B MoE 用全新非对称架构,输入只激活 8B,KV 缓存对 HBM 需求降至上一代 1/4,原生多模态、1M 上下文、MIT 开源。基准超越 V4 Pro,9 月 14 日后 V4 Pro 请求全部路由到它,Agent 长任务成本大降。本文讲清它的能力边界、价格怎么算、怎么迁移,以及目前真实存在的短板。

9 月 10 日,DeepSeek 正式发布 V4.1 Flash 并同步开源权重。这不是一次常规的小版本迭代,而是 DeepSeek 全新模型结构系列里最小的一款——它带着一个全新的非对称架构、一个被压缩到上一代四分之一的 KV 缓存,以及一个相当狠的决定:直接下线旗舰 V4 Pro。

对天天跑 AI Agent 的人来说,这条新闻的分量不在”又发了个模型”,而在于它把长任务里最贵的那一项——缓存命中成本——按下去了一大截

一、这次变了什么:非对称架构 + KV 缓存大压缩

V4.1 Flash 是 552B 参数的 MoE 模型,但它最特别的地方是采用了全新的 Causal-Encoder-Decoder 结构:40 层 Transformer 被拆成 20 层 Causal Encoder 加 20 层 Decoder,输入和输出不对称——读提示词时每个 token 只激活 8B 参数,写回答时激活 16B。

这跟以往”一个模型一套激活参数”的思路不一样。Decoder 的全局 KV 缓存直接从 Encoder 的最终隐藏状态投影出来,不再逐层自己生成一份,缓存自然就小了。

省下来的东西是实打实的:

  • 对 HBM 的需求降到上一代的 1/4
  • 对 SSD 的需求降到 1/8
  • 单 token 的全局 KV 占用约 890 字节,比 DeepSeek V4-Flash 少了约四分之三。
  • 相对初代模型,KV 缓存已经缩小了 437 倍

实现手段有两处值得记:一是主 KV 用 FP4(E2M1) 缓存,每 16 个通道配一个 E4M3 scale;二是 SWA Bounded Replay 只回放最近窗口的 token 来重建滑动窗口注意力的 KV 状态,这部分不写进 SSD。换句话说,压缩不是靠”少记点”,而是靠架构和数值格式两头一起省。

原生多模态视觉理解、1M 上下文窗口、MIT 许可证开源,这些也都在这版里。权重已上传 Hugging Face,模型卡里权重是 FP8 量化格式,总量接近 484.6B——想本地跑基本别想了,走 API 更现实。

二、性能与价格:基准超旗舰,价格继续往下压

DeepSeek 官方给出的对比里,V4.1 Flash 在多项评测上超过了自家 V4 Pro:

  • Terminal-Bench 2.1:90.6(V4 Pro 87.9)
  • Agent’s Last Exam:31.8(V4 Pro 25.7)
  • CyberGym:88.1(V4 Pro 83.3)
  • Automation-Bench:54.8(V4 Pro 31.8)
  • DeepSWE v1.1:74.2

不过最该记住的一组数字是 Terminal-Bench 4.0:V4.1 Flash 只有 31.2,而被它拿来对比的 Claude Opus 5.0 是 51.8。也就是说,在”业界常年引用”的编程与 Agent 老基准上它已经打平前沿模型,但在最新、最难的测试上还有明显差距。这个分寸,官方自己也没藏。

价格方面,新价从 9 月 10 日 12:00(北京时间)起生效,仍走峰谷定价,闲时是高峰的一半:

  • 输入(缓存命中):闲时 0.02 元 / 百万 token,高峰 0.04 元。
  • 输入(缓存未命中):闲时 1 元 / 百万 token,高峰 2 元。
  • 输出:闲时 4 元 / 百万 token,高峰 8 元。

高峰时段定义为周一至周五的 9:00–12:00 与 14:00–18:00,其余算闲时。海外口径上,闲时输入(缓存未命中)约 0.15 美元 / 百万 token,输出约 0.6 美元。

DeepSeek 说得很直白:Agent 场景里缓存命中费用占比很高,压 KV 缓存就是直接砍这类任务的账单。如果你有批处理、离线索引、夜间跑的自动化流程,把它们挪到闲时,成本还能再对折。

三、怎么迁移:三步换到新模型

迁移门槛很低,基本不用改代码:

  1. 把模型名改成 deepseek-flash,即可调用 V4.1 Flash(API 原生支持多模态)。
  2. 旧模型 V4 Flash 与 V4 Flash Vision Exp 已下线;出于兼容,deepseek-v4-flashdeepseek-v4-flash-vision-exp 这两个名字会暂时路由到 V4.1 Flash,所以短期不改也不会报错。
  3. 如果你的代码里写死了 deepseek-v4-pro,注意 9 月 14 日 12:00 之后,到 V4.1 Pro 上线之前,这些请求会全部路由到 V4.1 Flash 并按新单价计费。趁这两天把模型名和预算都核一遍。

生态侧也跟上了:腾讯 WorkBuddy、CodeBuddy 与 OpenCode 已作为官方合作伙伴全量接入,硅基流动等第三方平台 Day 0 上线。想把 DeepSeek Harness 那套”一切皆插件”的 Agent 框架接上新模型,现在是最顺的时候。

四、影响分析:Agent 的成本结构正在被重写

这一轮发布真正的信号,是模型厂商开始把”长任务经济性”当作第一竞争维度

过去一年 Agent 落地的最大拦路虎不是模型不够聪明,而是”跑得起的活太少”——一次多步骤任务要反复带上越来越长的上下文,缓存命中的开销悄悄吃掉预算。V4.1 Flash 把 KV 缓存压到 1/4,等于把这个天花板往上抬了一截。

对国内团队,至少三件事值得现在就想:

  • 长任务可以更敢跑了。 过去因为成本而砍掉的”多轮自我纠错””全量代码库索引”类流程,现在可以重新算一遍账。
  • 模型选择要按场景分层。 老基准打平、新基准落后,意味着”高难度推理”和”高频批量执行”该用不同模型,而不是一个模型打天下。这一点和 MCP 协议无状态化之后”Agent 终于能上生产”的判断是一致的。
  • 别只看官方榜。 DeepSeek 自己披露了一个关键细节:同一个模型,在 mini-SWE 下 DeepSWE v1.1 得 74.2,用自己的 harness 得 72.6,在 Claude Code 下 69.8,在 Codex 下 65.6——脚手架不同,差距接近 9 分。你在哪套工具里跑,比榜单第一行更重要。

顺带说一句,官方对比表里没有列 GPT-6 Astra。OpenAI 报的 Astra 在 Terminal-Bench 4.0 上是 57.9,而 V4.1 Flash 是 31.2。这个缺失的一行,恰恰是今天真要选编程 Agent 的人最该自己去补的功课。想要国产替代又怕断供的,可以连同 Kimi 原生兼容 Codex 和 Claude Code一起横向对比着看。

五、老达点评

DeepSeek 这次的路子很清楚:不跟你拼参数,拼的是”同样一块 GPU,一天能替你干多少活”。

  • 如果你在跑自动化流程、内容批处理、代码库巡检这类高频重复任务,V4.1 Flash 值得立刻切过去试——光是闲时价加缓存压缩这一项,账单变化就很直观。
  • 如果你在做高难度推理(复杂重构、算法设计、长链规划),先别急着把 V4 Pro 一次性换掉,等 V4.1 Pro 上线再看。Terminal-Bench 4.0 那 31.2 分说明它的上限还没到 Opus 5 的层级。
  • 如果你是自建 Agent 平台的团队,这版最值钱的是那个 1–100 的推理强度旋钮——它让你能在”准确性”和”单次成本”之间连续调节,而不是换模型。这比多一个模型更实用。

我们也聊过 DeepSeek 首款视觉模型,当时它用一分钱看九张图把视觉理解的价格打下来;这次 V4.1 Flash 把”看得懂”和”记得省”合到了一起。从 Codex 持久模式那种”AI 干完活还主动找活干”的趋势看,接下来真正卡住 Agent 的,会越来越是成本和上下文,而不是智商——DeepSeek 这一步,正好踩在这条线上。

相关阅读

专题入口:

发表评论

您的电子邮箱地址不会被公开,必填项已标注 *