9 月 10 日,DeepSeek 正式发布 V4.1 Flash 并同步开源权重。这不是一次常规的小版本迭代,而是 DeepSeek 全新模型结构系列里最小的一款——它带着一个全新的非对称架构、一个被压缩到上一代四分之一的 KV 缓存,以及一个相当狠的决定:直接下线旗舰 V4 Pro。
对天天跑 AI Agent 的人来说,这条新闻的分量不在”又发了个模型”,而在于它把长任务里最贵的那一项——缓存命中成本——按下去了一大截。
一、这次变了什么:非对称架构 + KV 缓存大压缩
V4.1 Flash 是 552B 参数的 MoE 模型,但它最特别的地方是采用了全新的 Causal-Encoder-Decoder 结构:40 层 Transformer 被拆成 20 层 Causal Encoder 加 20 层 Decoder,输入和输出不对称——读提示词时每个 token 只激活 8B 参数,写回答时激活 16B。
这跟以往”一个模型一套激活参数”的思路不一样。Decoder 的全局 KV 缓存直接从 Encoder 的最终隐藏状态投影出来,不再逐层自己生成一份,缓存自然就小了。
省下来的东西是实打实的:
- 对 HBM 的需求降到上一代的 1/4。
- 对 SSD 的需求降到 1/8。
- 单 token 的全局 KV 占用约 890 字节,比 DeepSeek V4-Flash 少了约四分之三。
- 相对初代模型,KV 缓存已经缩小了 437 倍。
实现手段有两处值得记:一是主 KV 用 FP4(E2M1) 缓存,每 16 个通道配一个 E4M3 scale;二是 SWA Bounded Replay 只回放最近窗口的 token 来重建滑动窗口注意力的 KV 状态,这部分不写进 SSD。换句话说,压缩不是靠”少记点”,而是靠架构和数值格式两头一起省。
原生多模态视觉理解、1M 上下文窗口、MIT 许可证开源,这些也都在这版里。权重已上传 Hugging Face,模型卡里权重是 FP8 量化格式,总量接近 484.6B——想本地跑基本别想了,走 API 更现实。
二、性能与价格:基准超旗舰,价格继续往下压
DeepSeek 官方给出的对比里,V4.1 Flash 在多项评测上超过了自家 V4 Pro:
- Terminal-Bench 2.1:90.6(V4 Pro 87.9)
- Agent’s Last Exam:31.8(V4 Pro 25.7)
- CyberGym:88.1(V4 Pro 83.3)
- Automation-Bench:54.8(V4 Pro 31.8)
- DeepSWE v1.1:74.2
不过最该记住的一组数字是 Terminal-Bench 4.0:V4.1 Flash 只有 31.2,而被它拿来对比的 Claude Opus 5.0 是 51.8。也就是说,在”业界常年引用”的编程与 Agent 老基准上它已经打平前沿模型,但在最新、最难的测试上还有明显差距。这个分寸,官方自己也没藏。
价格方面,新价从 9 月 10 日 12:00(北京时间)起生效,仍走峰谷定价,闲时是高峰的一半:
- 输入(缓存命中):闲时 0.02 元 / 百万 token,高峰 0.04 元。
- 输入(缓存未命中):闲时 1 元 / 百万 token,高峰 2 元。
- 输出:闲时 4 元 / 百万 token,高峰 8 元。
高峰时段定义为周一至周五的 9:00–12:00 与 14:00–18:00,其余算闲时。海外口径上,闲时输入(缓存未命中)约 0.15 美元 / 百万 token,输出约 0.6 美元。
DeepSeek 说得很直白:Agent 场景里缓存命中费用占比很高,压 KV 缓存就是直接砍这类任务的账单。如果你有批处理、离线索引、夜间跑的自动化流程,把它们挪到闲时,成本还能再对折。
三、怎么迁移:三步换到新模型
迁移门槛很低,基本不用改代码:
- 把模型名改成
deepseek-flash,即可调用 V4.1 Flash(API 原生支持多模态)。 - 旧模型 V4 Flash 与 V4 Flash Vision Exp 已下线;出于兼容,
deepseek-v4-flash与deepseek-v4-flash-vision-exp这两个名字会暂时路由到 V4.1 Flash,所以短期不改也不会报错。 - 如果你的代码里写死了
deepseek-v4-pro,注意 9 月 14 日 12:00 之后,到 V4.1 Pro 上线之前,这些请求会全部路由到 V4.1 Flash 并按新单价计费。趁这两天把模型名和预算都核一遍。
生态侧也跟上了:腾讯 WorkBuddy、CodeBuddy 与 OpenCode 已作为官方合作伙伴全量接入,硅基流动等第三方平台 Day 0 上线。想把 DeepSeek Harness 那套”一切皆插件”的 Agent 框架接上新模型,现在是最顺的时候。
四、影响分析:Agent 的成本结构正在被重写
这一轮发布真正的信号,是模型厂商开始把”长任务经济性”当作第一竞争维度。
过去一年 Agent 落地的最大拦路虎不是模型不够聪明,而是”跑得起的活太少”——一次多步骤任务要反复带上越来越长的上下文,缓存命中的开销悄悄吃掉预算。V4.1 Flash 把 KV 缓存压到 1/4,等于把这个天花板往上抬了一截。
对国内团队,至少三件事值得现在就想:
- 长任务可以更敢跑了。 过去因为成本而砍掉的”多轮自我纠错””全量代码库索引”类流程,现在可以重新算一遍账。
- 模型选择要按场景分层。 老基准打平、新基准落后,意味着”高难度推理”和”高频批量执行”该用不同模型,而不是一个模型打天下。这一点和 MCP 协议无状态化之后”Agent 终于能上生产”的判断是一致的。
- 别只看官方榜。 DeepSeek 自己披露了一个关键细节:同一个模型,在 mini-SWE 下 DeepSWE v1.1 得 74.2,用自己的 harness 得 72.6,在 Claude Code 下 69.8,在 Codex 下 65.6——脚手架不同,差距接近 9 分。你在哪套工具里跑,比榜单第一行更重要。
顺带说一句,官方对比表里没有列 GPT-6 Astra。OpenAI 报的 Astra 在 Terminal-Bench 4.0 上是 57.9,而 V4.1 Flash 是 31.2。这个缺失的一行,恰恰是今天真要选编程 Agent 的人最该自己去补的功课。想要国产替代又怕断供的,可以连同 Kimi 原生兼容 Codex 和 Claude Code一起横向对比着看。
五、老达点评
DeepSeek 这次的路子很清楚:不跟你拼参数,拼的是”同样一块 GPU,一天能替你干多少活”。
- 如果你在跑自动化流程、内容批处理、代码库巡检这类高频重复任务,V4.1 Flash 值得立刻切过去试——光是闲时价加缓存压缩这一项,账单变化就很直观。
- 如果你在做高难度推理(复杂重构、算法设计、长链规划),先别急着把 V4 Pro 一次性换掉,等 V4.1 Pro 上线再看。Terminal-Bench 4.0 那 31.2 分说明它的上限还没到 Opus 5 的层级。
- 如果你是自建 Agent 平台的团队,这版最值钱的是那个 1–100 的推理强度旋钮——它让你能在”准确性”和”单次成本”之间连续调节,而不是换模型。这比多一个模型更实用。
我们也聊过 DeepSeek 首款视觉模型,当时它用一分钱看九张图把视觉理解的价格打下来;这次 V4.1 Flash 把”看得懂”和”记得省”合到了一起。从 Codex 持久模式那种”AI 干完活还主动找活干”的趋势看,接下来真正卡住 Agent 的,会越来越是成本和上下文,而不是智商——DeepSeek 这一步,正好踩在这条线上。
相关阅读
- DeepSeek Harness 开源:一个「一切皆插件」的 Agent 框架——把新模型接进自有 Agent 框架的现成底座。
- DeepSeek 首款视觉模型上线——同一家的视觉能力演进,可与 V4.1 Flash 的原生多模态对照。
- MCP 诞生以来最大一次改版:协议彻底无状态化——Agent 上生产的协议层前提,成本优化是配套的另一半。
- Codex 要变”不睡觉的程序员”了?OpenAI 测试持久模式——长任务常态化,正是 KV 缓存压缩最直接的受益场景。
专题入口: