让一个 270 亿参数的大模型,每次只回答一句”是或否”,就像开卡车去送一个信封——能力用不上,成本却一分不少。
10 月 1 日,Cloudflare 在自己的生日周活动里开源了两款专门干这种活的模型:Clef 与 Clef-flash。它们不写句子,只输出概率,也就是在预先给定的选项里挑一个更像的答案。Cloudflare 说这是公司第一次自己训练并开源模型,权重按 Apache 2.0 挂在 Hugging Face 上,托管在自家的 Workers AI 边缘网络上。
对做 AI 智能体与自动化的人来说,这件事的价值不在”又多了个模型”,而在于它把 Agent 里最频繁、最不值钱的那一步——做判断——单独拆出来做成了廉价零件。
决策模型到底是个什么东西
先把这个概念说清楚,因为它跟平常说的”大模型”不是一回事。
你给通用大模型一段话,它会写一段话回来。你给它一个客服工单,它可能回你三百字的分析。但你真正想要的,往往只是”这单该转给财务还是技术支持”。
决策模型干的就是这件事:输入一段状态和一组有限的问题,输出每个答案的概率。它不生成文本,一个字的作文都不写。支持三种问法——是或否、从给定选项里挑一个、按刻度打分,单次请求最多可以问 64 个问题。
Cloudflare 这两款的差别在体量上:
- Clef:270 亿参数,基于 Qwen3.8-27B,带视觉编码器,单次最多读 4 张图
- Clef-flash:90 亿参数,基于 Qwen3.5-9B,为延迟敏感场景准备
- 两者都是 6.4 万 token 上下文,都能吃文本、JSON、图片和视频帧
这里有个容易被忽略的细节:视觉输入是 Clef 相对老前辈的真正差异点。这个品类的开创者是 TypeSafe AI 的 Jev,Jev 只吃文本。而 Clef 可以直接看一帧画面做判断——截图分诊、单据类型识别、上传图片审核,原来要串一条流水线的活,现在一次调用就够了。
39 毫秒意味着什么
数字摊开看:Clef-flash 的中位决策延迟约 38.8 毫秒,Clef 约 209 毫秒,而被对标的 Jev 是 524 毫秒。
38.8 毫秒是什么概念?用户眨一次眼大约 100 到 150 毫秒。也就是说,这个判断快到用户根本感觉不到有人在做判断。
这件事的意义在于调用位置会变。以前你只敢把 AI 判断放在”看起来可疑”的请求上,因为贵、因为慢;现在可以先无脑过一遍闸门。真正让 39 毫秒在线上跑得住的还有第二个原因:模型跑在 Cloudflare 的边缘 GPU 上,跟你的 Workers 在同一张网里,省掉的是网络往返时间。
跑分很好看,但要看清是谁跑的
Cloudflare 给了几组对比。挑几个有代表性的:
- BANKING77(给银行客服消息分类):Clef 宏观 F1 94.20,Jev 79.74
- BFCL(挑对要调用的工具):Clef 98.47、Clef-flash 98.76,Jev 95.75
- CLINC150+OOS(意图分类并识别出范围外的):Clef 97.43,Jev 89.27
但有两处必须提醒。
第一,这些是 Cloudflare 自己跑的数字,而且 Cloudflare 没说 Jev 那边的分数是哪来的。同一份材料里也承认,在 GPQA Diamond 和 MMLU-Pro 这两个考”知不知道”的基准上,Jev 还是领先 Clef。这很合理:决策模型擅长归类,不擅长知道。如果你的判断依赖模型脑子里有知识,而不是你喂给它的上下文,那它帮不上忙。
第二,价格数字不是官方发布里写的。Cloudflare 的公告正文没有报价,只把链接指向定价页;目前流传的每百万输入 token 0.24 美元(Clef)和 0.09 美元(Clef-flash)来自二手报道。输出 token 不计费——听起来很划算,但决策模型本来就没有输出文本,这个”免费”含金量要自己掂量。
8 天里挤进 4 个决策模型
这条线今年突然热起来了,热闹到有点拥挤:
- 9 月 30 日,Liquid AI 发了 d1
- 10 月 1 日,Cloudflare 发了 Clef 和 Clef-flash,亚马逊几乎同时发了 Strands Decider 2B
- 再往前,是把这个品类做起来的 TypeSafe AI 的 Jev
四家做的是同一件事,说的也是同一套话:让 Agent 去问一个 27B 模型”请输出 JSON”,是在为它用不到的能力付钱。 这也是为什么 给 AI 编程 Agent 收权限、把 Agent 运行时的冷启动从 30 秒压到 2 秒 和今天的”把判断拆出来”是同一条线上的事——Agent 要进生产,卡点从来不在智商,在成本和确定性。
Cloudflare 的打法不在架构,在分发:你的 Workers 跑在哪儿,模型就在哪儿,38.8 毫秒才不是只存在于跑分机器上的数字。
上车前先看清硬件和接口
- 接口兼容:Clef 兼容 Jev 的 API。已经按 Jev 写好集成的人,换的是 endpoint,不是整套重写。
- 权重开源:Apache 2.0,Hugging Face 可下载,可本地部署。但要注意,Cloudflare 只放了权重和配置,训练数据是私有的。这跟另一个”开源”模型的许可陷阱是不同的问题:这次许可没问题,透明度有保留。
- 硬件门槛不低:据 The Register 的报道,Clef-flash 本地跑需要至少 41GB 显存,完整的 Clef 在全上下文、单并发下大约要 85GB。也就是说”开源”不等于”能在你的笔记本上跑”,这个品类里最轻的那档也没轻到消费级显卡的份上。
- 微调不自助:Cloudflare 同时宣布了针对 Clef 的强化学习微调服务,由 AI Gateway、Workers AI 和 Containers 拼起来。但它不是自助式的,起步阶段要 Cloudflare 工程师陪着做,公共平台还在后面。
三步先跑起来
如果你已经在用 Workers,值得花半小时验证一下:
- 先换小的。从 Clef-flash 开始,别一上来就用 27B 的 Clef。Cloudflare 自己的建议也是先试 flash。
- 挑一个真实高频判断。别做 demo,直接从线上挑一类反复出现、规则写得又烂又长的判断——工单分类、该不该升级、工具选哪个。
- 对比三条基线。同一个判断,分别用 Clef-flash、你现在用的大模型、以及纯规则各跑一遍,看准确率差多少、每千次调用省多少钱。
接 MCP 工具链的话,之前整理过一份 5 个免费 MCP Server,可以先把工具选择这一步挂上去试。
优缺点,摊开说
优点:
- 快到可以放进热路径,用户无感
- 输出是概率不是文本,结果可预期、可判断,不用再写正则去解析
- 能读图和视频,这是同品类里的差异点
- 兼容 Jev API,迁移成本低
- Apache 2.0,权重可自持
缺点:
- 只能做封闭选项的判断,开放性问题一概不接
- 官方公告没给价格,成本要自己去定价页确认
- 本地部署门槛偏高,最轻的也要 41GB 显存
- 微调服务不自助,想按自己业务训一版得排工程师
- 训练数据不公开,”开源”的纯度要打折
适合谁,谁先别急
适合:已经在 Cloudflare Workers 上跑 Agent 的团队;每天有大量”分类、路由、放行/拦截”判断的业务;想把判断从大模型里拆出来降本的工程团队。
先别急:判断需要模型”知道”点什么,而不是”挑一个”的;量小到每天几千次调用,省下的钱还不够折腾;以及不愿意把判断逻辑绑在某一朵云上的团队——边缘托管是它快的理由,也是它绑定的理由。
替代方案
选型这件事没有标准答案,AI 工具评测专题里按场景整理过一批横向对比,可以先对一下自己的需求再决定。
- TypeSafe AI 的 Jev:这个品类的开创者,文本判断成熟,API 是别人适配它的标准
- 亚马逊 Strands Decider 2B:20 亿参数、可本地跑,权重和训练脚本都放出来了,适合想在本地做闸门的
- 不换模型,换用法:如果你的判断量不大,继续用 Grok 4.7 那种按每件活算成本的方式 反而更省心
- 继续用大模型:判断规则经常变、边界模糊、需要解释理由的,通用模型仍然更稳
老达点评
第一,这次真正值钱的不是模型,是”判断”被拆成了标准件。以前大家把 Agent 的智能当成一整块,现在开始按工序拆:写代码的归大模型,做判断的归小模型,管权限的归策略层。谁能把工序拆清楚,谁的 Agent 成本就降得下来。
第二,39 毫秒这个数要跟”能放在哪”一起看。单看速度意义不大,边缘部署加上低延迟,才让它能被塞进每一次请求前面。技术指标要落到调用位置上才有商业价值,这一点 Cloudflare 想得比别人清楚。
第三,“开源”这两个字还得逐条读。许可确实干净,权重确实能下,但训练数据私有、微调不自助、本地跑要 41GB 显存起。三句话都对,合起来就是:开放的是使用,不开放的是复现。
第四,8 天 4 家一起冲,说明这是个真需求,也说明要降温看。这种密度通常意味着半年内会打价格战、会出现同质化。现在值得花半小时验证,但不值得今天就把生产架构重做一遍。
参考来源:Cloudflare 官方博客《Introducing Clef: our open-source decision models, and new RL fine-tuning platform》、DataNorth、TechDefused、Crypto Briefing、The Register 相关报道与模型卡。文中跑分与价格均标注了口径来源,厂商自测数据请自行复核。