2026 年 10 月 1 日,Cloudflare 在官方博客发布了自家训练的首批决策模型 Clef 和 Clef-flash,同时上线一个新的强化学习微调平台。两个模型即日起托管在 Workers AI 上,权重以 Apache 2.0 协议在 Hugging Face 开源,并且完全兼容 TypeSafe Jev 的 API——已有 Jev 集成的开发者换个 endpoint 和模型名就能切换。
决策模型到底是什么
决策模型和大语言模型解决的是不同的问题。LLM 是开放式的:你问它一个问题,它逐 token 生成一段文字回答,你还得再解析。决策模型只做“判断”:你丢给它一段输入和几个定好类型的题目,它直接返回每个可选答案的概率,代码拿到数字就能分支,不用解析文字。Clef 支持三种题型:是非题返回“是”的概率,单选题给出每个选项的概率和置信度,打分题按你定义的量表返回概率加权分数。
Clef 的三张牌:更快、看得懂图、权重开源
和两周前走红的 TypeSafe Jev 相比,Cloudflare 给 Clef 准备了三个差异点。第一是速度:在 43 项评测里,Clef 的中位延迟为 209.3 毫秒,Clef-flash 只要 38.8 毫秒,而 Jev 是 524.1 毫秒;p95 延迟 Clef-flash 为 122.4 毫秒,不到 Jev 的四分之一。第二是多模态:Clef 带视觉编码器,能直接分类图片内容,Jev 目前只做文本;上下文窗口给到 64k,是 Jev 的两倍。第三是开源:两个模型权重全部公开,Apache 2.0 协议,可本地部署——在 Jev、OpenAI Decisions API、Cloudflare Clef 这一波决策模型里,它是唯一开源权重的一家。
准确度上,Cloudflare 贴出了 Jev Decision Index 的对比:在 BANKING77 上 Clef 的 macro-F1 为 94.20、Clef-flash 90.93,Jev 是 79.74;在 BFCL 上两款分别达到 98.47 和 98.76。不过 When2Call 和 BRIGHT 两项仍是 Jev 占优,说明没有哪家通吃所有场景。自家内部已经在用:威胁情报团队用 Clef 给域名分类,一个网站抓取、渲染加分类 2.2 秒完成,而最快的通用 LLM gpt-oss-120b 同样流程要 4.7 秒,还只返回两个分类。
附带的 RL 微调平台
和模型一起发布的还有一套强化学习微调服务:先由 Cloudflare 的前线部署工程师团队以 hands-on 方式帮客户调优,之后再做成自助平台。链路复用了 Cloudflare 已有的 AI 平台组件——AI Gateway 把线上 AI 流量沉淀成数据集,Workers AI 跑 rollouts,Containers 做 RL 沙箱评分回放,新的 Trainer 更新权重,训好的模型再 redeploy 回 Workers AI。
这个时间点很微妙:TypeSafe Jev 在 9 月 15 日引爆话题,OpenAI 在 9 月 29 日推出 Decisions API(有限预览),Cloudflare 在 10 月 1 日跟进。两周内三家入场,说明“agent 做决策”这个环节正在从“调 LLM 碰运气”变成独立的基础设施层。对开发者的实际意义是:客服分流、工单路由、内容审核、升级判断这类“先分类再行动”的场景,现在有了一条更快更便宜的专用通道,而且因为 API 兼容 Jev,迁移成本很低。
边界也要说清楚:上面的基准成绩全部来自 Cloudflare 自测,独立验证还要再看;决策模型只负责“判断”,判断之后“做什么”仍然要靠 LLM 或业务代码。把它放进 agent 热路径之前,先在自己的数据上跑一遍校准。