8 月 13 日凌晨,DeepSeek 没开发布会、没发预告,直接把 V4 Pro 正式版挂上了 API 文档。模型名还是那个 deepseek-v4-pro,调用方式一个字没改,但”里子”换了一代——你之前 API 调到的 v4-pro 预览版,和现在的正式版,差距大到不像同一个模型。
一次”换代”式更新,Agent 分数集体暴涨
DeepSeek 这轮更新的关键词只有一个:Agent。
先看几组最直观的数字(预览版 → 正式版):
- Terminal Bench(终端操作):72.1 → 87.9
- DeepSWE(真实软件工程):12.8 → 62.7,直接翻了近 5 倍
- Cybergym(安全攻防):52.7 → 83.3
- AutomationBench(工作流自动化):12.8 → 31.8
- DSBench-Hard:31.1 → 67.2,翻了一倍还多
其中 DeepSWE 从 12.8 跳到 62.7 最值得细看。这个测试考的是”在一个真实、复杂的代码仓库里,能不能独立完成跨文件、仓库级的修改”——这是过去所有模型最拉胯的地方。从 12.8 到 62.7,意味着它不再只是帮你补全几行代码,而是真的能当半个工程师使。
三项硬核能力,全部挤进第一梯队
把这套分数摆到台面上跟别人比,DeepSeek V4 Pro 的目标很清晰——不追求单项第一,但哪一项都不掉队:
- 终端操作:87.9 分,仅次于 Kimi-K3 的 88.3,甩开 Opus 4.8 的 85.0
- 安全攻防:83.3 分,直接登顶,略超 Anthropic 的 Fable 5,能自主做代码审计、定位漏洞、生成 PoC
- 高难推理(HLE 带工具):60.0,仅次于 Fable 5 的 63.0
- 代码工程(NL2Repo):61.5,仅次于 Opus 4.8 的 69.7
一句话总结:编程、运维、安全这三个开发者最刚需的场景,它没有一个掉出第一梯队。对国产开源模型来说,”无短板”比”单项第一”难得多,也值钱得多。
价格还是白菜价,但有两个代价
价格这块,DeepSeek 一如既往地狠:
- 输入缓存命中:0.025 元/百万 Token
- 输入未命中:3 元/百万 Token
- 输出:6 元/百万 Token
拿它跟海外同级模型比,基本就是人家的一个零头——有人算过,Claude Opus 4.8 跑一次任务的成本,是 V4 Pro 的 44 倍。
而且这次正式版把 Agent 的”硬刚需”都配齐了:1M 上下文、384K 最大输出、支持 Responses API 和 Anthropic API 格式、能直接接入 Codex,迁移成本几乎为零。
但天下没有免费的午餐,两个代价要提前说清楚:
第一,并发限制从 Flash 的 2500 降到 500。能力越强算力越贵,这是物理规律。
第二,有开发者实测发现,API 输出的思维链变成了”山顶洞语”——单个字都认识,连起来前言不搭后语。这大概率是官方为了省 Token 做的优化,代价就是写作能力被牺牲了,一切能力优先为 Coding 让位。
老达点评
这次 V4 Pro 正式版,让我真正在意的不是分数,而是一个趋势信号:国产开源模型已经把战场从”刷推理分”推进到了”比真实干活”。
过去大家拼的是 MMLU、拼 benchmark 里的选择题正确率;现在拼的是 Terminal Bench、Cybergym、DeepSWE——这些全是在真实环境里让模型”长任务、多步骤、独立完成一件事”的能力。换句话说,大模型的下一阶段,比的不是”会不会答”,而是”能不能把活干完”。
对普通开发者,我的建议很实在:如果你的场景是写代码、搞运维、做安全审计,V4 Pro 正式版可以切过去试试,尤其是 API 迁移成本几乎为零;但如果你的主要用途是写文章、写文案,那还是先等等——思维链被优化成”山顶洞语”之后,文字输出的质量确实肉眼可见地降了。
相关阅读
如果你还没上手 DeepSeek,可以先看这两篇:
想了解国产大模型整体格局,看这篇:
更多 AI 编程与 Agent 相关内容,可以逛逛 AI 编程工具专题 和 DeepSeek 专题。