Cloudflare 开源决策模型 Clef:39 毫秒做一次判断,Agent 不用再问大模型

Cloudflare Clef 决策模型示意图:一枚小型琥珀色判断闸门在数据管线中快速放行或拦截请求
内容摘要

Cloudflare 10 月 1 日开源 Clef 与 Clef-flash 两款决策模型,只回概率不写文字,最快 39 毫秒给一次判断,还能读图和视频。判断该调哪个工具、这条消息要不要拦下来这类小活,从此可以交给便宜的小模型,不必每次都请通用大模型出场,省钱也省等待。

让一个 270 亿参数的大模型,每次只回答一句”是或否”,就像开卡车去送一个信封——能力用不上,成本却一分不少。

10 月 1 日,Cloudflare 在自己的生日周活动里开源了两款专门干这种活的模型:Clef 与 Clef-flash。它们不写句子,只输出概率,也就是在预先给定的选项里挑一个更像的答案。Cloudflare 说这是公司第一次自己训练并开源模型,权重按 Apache 2.0 挂在 Hugging Face 上,托管在自家的 Workers AI 边缘网络上。

对做 AI 智能体与自动化的人来说,这件事的价值不在”又多了个模型”,而在于它把 Agent 里最频繁、最不值钱的那一步——做判断——单独拆出来做成了廉价零件。

决策模型到底是个什么东西

先把这个概念说清楚,因为它跟平常说的”大模型”不是一回事。

你给通用大模型一段话,它会写一段话回来。你给它一个客服工单,它可能回你三百字的分析。但你真正想要的,往往只是”这单该转给财务还是技术支持”。

决策模型干的就是这件事:输入一段状态和一组有限的问题,输出每个答案的概率。它不生成文本,一个字的作文都不写。支持三种问法——是或否、从给定选项里挑一个、按刻度打分,单次请求最多可以问 64 个问题。

Cloudflare 这两款的差别在体量上:

  • Clef:270 亿参数,基于 Qwen3.8-27B,带视觉编码器,单次最多读 4 张图
  • Clef-flash:90 亿参数,基于 Qwen3.5-9B,为延迟敏感场景准备
  • 两者都是 6.4 万 token 上下文,都能吃文本、JSON、图片和视频帧

这里有个容易被忽略的细节:视觉输入是 Clef 相对老前辈的真正差异点。这个品类的开创者是 TypeSafe AI 的 Jev,Jev 只吃文本。而 Clef 可以直接看一帧画面做判断——截图分诊、单据类型识别、上传图片审核,原来要串一条流水线的活,现在一次调用就够了。

39 毫秒意味着什么

数字摊开看:Clef-flash 的中位决策延迟约 38.8 毫秒,Clef 约 209 毫秒,而被对标的 Jev 是 524 毫秒。

38.8 毫秒是什么概念?用户眨一次眼大约 100 到 150 毫秒。也就是说,这个判断快到用户根本感觉不到有人在做判断。

这件事的意义在于调用位置会变。以前你只敢把 AI 判断放在”看起来可疑”的请求上,因为贵、因为慢;现在可以先无脑过一遍闸门。真正让 39 毫秒在线上跑得住的还有第二个原因:模型跑在 Cloudflare 的边缘 GPU 上,跟你的 Workers 在同一张网里,省掉的是网络往返时间。

跑分很好看,但要看清是谁跑的

Cloudflare 给了几组对比。挑几个有代表性的:

  • BANKING77(给银行客服消息分类):Clef 宏观 F1 94.20,Jev 79.74
  • BFCL(挑对要调用的工具):Clef 98.47、Clef-flash 98.76,Jev 95.75
  • CLINC150+OOS(意图分类并识别出范围外的):Clef 97.43,Jev 89.27

但有两处必须提醒。

第一,这些是 Cloudflare 自己跑的数字,而且 Cloudflare 没说 Jev 那边的分数是哪来的。同一份材料里也承认,在 GPQA Diamond 和 MMLU-Pro 这两个考”知不知道”的基准上,Jev 还是领先 Clef。这很合理:决策模型擅长归类,不擅长知道。如果你的判断依赖模型脑子里有知识,而不是你喂给它的上下文,那它帮不上忙。

第二,价格数字不是官方发布里写的。Cloudflare 的公告正文没有报价,只把链接指向定价页;目前流传的每百万输入 token 0.24 美元(Clef)和 0.09 美元(Clef-flash)来自二手报道。输出 token 不计费——听起来很划算,但决策模型本来就没有输出文本,这个”免费”含金量要自己掂量。

8 天里挤进 4 个决策模型

这条线今年突然热起来了,热闹到有点拥挤:

  • 9 月 30 日,Liquid AI 发了 d1
  • 10 月 1 日,Cloudflare 发了 Clef 和 Clef-flash,亚马逊几乎同时发了 Strands Decider 2B
  • 再往前,是把这个品类做起来的 TypeSafe AI 的 Jev

四家做的是同一件事,说的也是同一套话:让 Agent 去问一个 27B 模型”请输出 JSON”,是在为它用不到的能力付钱。 这也是为什么 给 AI 编程 Agent 收权限、把 Agent 运行时的冷启动从 30 秒压到 2 秒 和今天的”把判断拆出来”是同一条线上的事——Agent 要进生产,卡点从来不在智商,在成本和确定性。

Cloudflare 的打法不在架构,在分发:你的 Workers 跑在哪儿,模型就在哪儿,38.8 毫秒才不是只存在于跑分机器上的数字。

上车前先看清硬件和接口

  • 接口兼容:Clef 兼容 Jev 的 API。已经按 Jev 写好集成的人,换的是 endpoint,不是整套重写。
  • 权重开源:Apache 2.0,Hugging Face 可下载,可本地部署。但要注意,Cloudflare 只放了权重和配置,训练数据是私有的。这跟另一个”开源”模型的许可陷阱是不同的问题:这次许可没问题,透明度有保留。
  • 硬件门槛不低:据 The Register 的报道,Clef-flash 本地跑需要至少 41GB 显存,完整的 Clef 在全上下文、单并发下大约要 85GB。也就是说”开源”不等于”能在你的笔记本上跑”,这个品类里最轻的那档也没轻到消费级显卡的份上。
  • 微调不自助:Cloudflare 同时宣布了针对 Clef 的强化学习微调服务,由 AI Gateway、Workers AI 和 Containers 拼起来。但它不是自助式的,起步阶段要 Cloudflare 工程师陪着做,公共平台还在后面。

三步先跑起来

如果你已经在用 Workers,值得花半小时验证一下:

  1. 先换小的。从 Clef-flash 开始,别一上来就用 27B 的 Clef。Cloudflare 自己的建议也是先试 flash。
  2. 挑一个真实高频判断。别做 demo,直接从线上挑一类反复出现、规则写得又烂又长的判断——工单分类、该不该升级、工具选哪个。
  3. 对比三条基线。同一个判断,分别用 Clef-flash、你现在用的大模型、以及纯规则各跑一遍,看准确率差多少、每千次调用省多少钱。

接 MCP 工具链的话,之前整理过一份 5 个免费 MCP Server,可以先把工具选择这一步挂上去试。

优缺点,摊开说

优点:

  • 快到可以放进热路径,用户无感
  • 输出是概率不是文本,结果可预期、可判断,不用再写正则去解析
  • 能读图和视频,这是同品类里的差异点
  • 兼容 Jev API,迁移成本低
  • Apache 2.0,权重可自持

缺点:

  • 只能做封闭选项的判断,开放性问题一概不接
  • 官方公告没给价格,成本要自己去定价页确认
  • 本地部署门槛偏高,最轻的也要 41GB 显存
  • 微调服务不自助,想按自己业务训一版得排工程师
  • 训练数据不公开,”开源”的纯度要打折

适合谁,谁先别急

适合:已经在 Cloudflare Workers 上跑 Agent 的团队;每天有大量”分类、路由、放行/拦截”判断的业务;想把判断从大模型里拆出来降本的工程团队。

先别急:判断需要模型”知道”点什么,而不是”挑一个”的;量小到每天几千次调用,省下的钱还不够折腾;以及不愿意把判断逻辑绑在某一朵云上的团队——边缘托管是它快的理由,也是它绑定的理由。

替代方案

选型这件事没有标准答案,AI 工具评测专题里按场景整理过一批横向对比,可以先对一下自己的需求再决定。

  • TypeSafe AI 的 Jev:这个品类的开创者,文本判断成熟,API 是别人适配它的标准
  • 亚马逊 Strands Decider 2B:20 亿参数、可本地跑,权重和训练脚本都放出来了,适合想在本地做闸门的
  • 不换模型,换用法:如果你的判断量不大,继续用 Grok 4.7 那种按每件活算成本的方式 反而更省心
  • 继续用大模型:判断规则经常变、边界模糊、需要解释理由的,通用模型仍然更稳

老达点评

第一,这次真正值钱的不是模型,是”判断”被拆成了标准件。以前大家把 Agent 的智能当成一整块,现在开始按工序拆:写代码的归大模型,做判断的归小模型,管权限的归策略层。谁能把工序拆清楚,谁的 Agent 成本就降得下来。

第二,39 毫秒这个数要跟”能放在哪”一起看。单看速度意义不大,边缘部署加上低延迟,才让它能被塞进每一次请求前面。技术指标要落到调用位置上才有商业价值,这一点 Cloudflare 想得比别人清楚。

第三,“开源”这两个字还得逐条读。许可确实干净,权重确实能下,但训练数据私有、微调不自助、本地跑要 41GB 显存起。三句话都对,合起来就是:开放的是使用,不开放的是复现。

第四,8 天 4 家一起冲,说明这是个真需求,也说明要降温看。这种密度通常意味着半年内会打价格战、会出现同质化。现在值得花半小时验证,但不值得今天就把生产架构重做一遍。

参考来源:Cloudflare 官方博客《Introducing Clef: our open-source decision models, and new RL fine-tuning platform》、DataNorth、TechDefused、Crypto Briefing、The Register 相关报道与模型卡。文中跑分与价格均标注了口径来源,厂商自测数据请自行复核。

发表评论

您的电子邮箱地址不会被公开,必填项已标注 *