DeepSeek 有个老毛病:文本推理强得吓人,但”看不见”。V4 全系都是纯文本模型,想让它看图,得在中间再挂一个视觉模型,一次任务付两份账单。
8 月 21 日,这个短板被补上了。DeepSeek 无预警上线了 V4 系列首款视觉模型 deepseek-v4-flash-vision-exp(实验版):纯文本能力一分没掉,多模态 Agent 能力直接逼近 Claude Opus 4.8,价格却还是 V4-Flash 的原价——图片按 token 计费,单张最多 384 token,1 分钱能看大约 9 张图。
这双”便宜的眼睛”到底值不值得接?我把它拆成三件事讲:能力、价格、场景。
一、DeepSeek 终于”睁眼”了:文本不掉分是最大的良心
先看它是什么。V4-Flash-Vision-Exp 本质是给 V4-Flash 纯文本模型加上了原生图像理解能力,名字里的 Exp 是实验版,先上线听反馈。
最难得的一点是:加了眼睛,文本没变差。官方口径是纯文本能力(Agent、推理、世界知识)与 V4-Flash 正式版持平,实测数据也印证了这点:Terminal Bench 2.1 拿 83.9、DeepSWE 59.3、NL2Repo 57.7、Toolathlon-Verified 75.9,七项 Agent 评测里六项还反超了前身 V4-Flash-0731。也就是说,DeepSeek 没有拿文本质量去换视觉能力,这跟很多”加模态掉智商”的模型不一样。
接口上它对开发者极其友好:Chat Completions、Anthropic Messages、OpenAI Responses 三种协议全兼容,从别的模型迁过来基本是改一行 base_url 的事。1M 上下文、384K 最大输出,规格跟 V4-Flash 完全对齐。想先看 DeepSeek 这条线怎么走过来的,可以翻翻之前写的 DeepSeek V4 Pro 正式版 和 DeepSeek 开源 Harness 框架 两篇。
二、”逼近 Opus 4.8″是怎么个逼近法
“逼近 Opus 4.8″是官方话术,得拆开看才有意义。多模态基准考的不是简单看图说话,而是把读截图、读图表、读示意图嵌进一长串工具调用里——考的是”带着眼睛干活”。
在四项多模态 Agent 基准上,Vision-Exp 跟 Opus 4.8 打成 2 比 2:Agents’ Last Exam 和 ZeroBench(Pass@5)两项反超,ApexBench(Pass@1)36.5 和 Chartography 64.3 落后几个点。Terminal Bench 2.1 拿到 83.9,距 Opus 4.8 的 85.0 只差 1.1 分。CyberGym 这类任务 Opus 4.8 依然领先。
需要说明,”逼近”是分项对比,不是整体超越。但评测方法值得点赞:所有公开基准都在自家 DeepSeek Harness 的 minimal 模式下跑,max effort、top_p 0.95、温度 1.0,参数全公开,谁都能复现。第三方机构 flowtivity 的结论很直接:在十分之一的价格上打出 2 比 2,这不是营销,是工程。这也延续了 DeepSeek 在 Agent 框架上的布局,之前写过的 DeepSeek Harness 开源 就是这套”模型 + 框架”打法的一部分。
三、价格账本:1 分钱看 9 张图,视觉费直接变赠品
这次最狠的就是价格。Vision-Exp 与 V4-Flash 完全同价:输入每百万 token 3 元(高峰)、1.5 元(谷时),输出 9 元(高峰)、4.5 元(谷时)。而 Opus 级的前沿模型,输入普遍在 5 到 15 美元一档,差距不是一点半点。
图片的计费方式更讲究:一张图最多折算 384 个 token,跟着文字一起按输入 token 计费,没有单独的视觉附加费。按高峰价算,一张图大约 0.12 分钱,1 分钱理论上能看 9 张图;同样情况下,某主流图像模型看一张要 2 分多,贵了将近 20 倍。新智元算过一笔账:1000 张图,成本大约 1 块钱。
还有两个数字值得记住:一是缓存命中时图片 token 吃到缓存后成本趋近于零,长会话里反复引用同一批截图会非常划算;二是并发限制给到 2500,是 V4-Pro 的 5 倍,批量跑截图任务的门槛也一并降了下来。唯一的提醒是峰谷价:北京时间上午 9-12 点和下午 2-6 点算高峰,把重活排到夜里能省一半。
四、能拿来干什么:三类真实场景
便宜的眼睛意味着什么?视觉 Agent 从”演示”变成”日用品”。三类场景最典型:
第一,截图复刻 UI。 媒体实测丢给它一张 OpenAI 官网截图,要求 1:1 复刻成单文件 HTML——布局、色值、间距、交互全还原。它先把图拆成结构描述,再逐行翻译成代码,交出来的页面几乎一模一样。做前端稿、抄竞品落地页,这条路直接通了。
第二,图表与长文档分析。 批量截图分析、数据图表理解、长文档检查,这些”盯着看”的活以前要专门接视觉模型,现在一个 model 字段切过去就行。
第三,GUI Agent 屏幕操作。 这是最值钱的方向:Agent 需要持续观察界面才能像人一样操作电脑,截图式工作流烧的就是输入 token——每张截图的单价,直接决定这类 Agent 是奢侈品还是日用品。Vision-Exp 把这张门票价格打了下来。想系统了解 Agent 怎么落地,可以参考老达AI实践专题和AI智能体与自动化专题里的系列文章。
五、怎么上手:一行代码的事
上手成本极低。API 三协议兼容,迁移就是改模型名的事;同一天 DeepSeek 还上线了免费的 Files API,上传图片拿 file_id 引用即可,不用自己拼 Base64;DeepSeek Harness v0.1.1 也同步原生支持了这个模型,还顺手修了一个沙箱逃逸漏洞。手机端识图模式也同步开了,普通用户可以直接体验。
要说保留项,就是这次没开放权重下载,Exp 实验版只走托管 API,想在自己机器上跑还得等。对开发者来说,过去”文本 Agent + 视觉理解”是两个模型、两份账单、两套错误处理,中间还要自己写路由;现在一个字段切过去,视觉按文本价算,这账怎么算都划算。
六、老达点评:便宜的眼睛,会改变什么
我的看法是,Vision-Exp 最大的意义不是”接近 Opus 4.8″,而是把视觉能力的价格打到了按张计费几乎可以忽略的程度。
DeepSeek 的打法已经很清晰:先把文本 Agent 做到旗舰水位,再用十分之一的价格把视觉能力”附赠”进去。当眼睛便宜到这个地步,”看屏幕干活”的 Agent 就从发布会 Demo 变成了能每天开着的工具——这跟上一轮 Codex Harness 开源暴露的逻辑是一样的:2026 年的竞争重心,已经从”模型多聪明”移到了”Agent 能不能跑得起、跑得稳”。
下一步值得盯的,是这双眼睛什么时候从 Exp 转正,以及开源权重那扇门什么时候开。在那之前,想试的开发者直接用起来——一分钱看 9 张图,这个账不用算。