AI导航

Cloudflare 开源 Clef 决策模型,27B 与 9B 双版本并推出 RL 微调平台

AI资讯
3 min read
0 次阅读

2026 年 10 月 1 日,Cloudflare 在官方博客发布了自家训练的首批决策模型 Clef 和 Clef-flash,同时上线一个新的强化学习微调平台。两个模型即日起托管在 Workers AI 上,权重以 Apache 2.0 协议在 Hugging Face 开源,并且完全兼容 TypeSafe Jev 的 API——已有 Jev 集成的开发者换个 endpoint 和模型名就能切换。

决策模型到底是什么

决策模型和大语言模型解决的是不同的问题。LLM 是开放式的:你问它一个问题,它逐 token 生成一段文字回答,你还得再解析。决策模型只做“判断”:你丢给它一段输入和几个定好类型的题目,它直接返回每个可选答案的概率,代码拿到数字就能分支,不用解析文字。Clef 支持三种题型:是非题返回“是”的概率,单选题给出每个选项的概率和置信度,打分题按你定义的量表返回概率加权分数。

Clef 的三张牌:更快、看得懂图、权重开源

和两周前走红的 TypeSafe Jev 相比,Cloudflare 给 Clef 准备了三个差异点。第一是速度:在 43 项评测里,Clef 的中位延迟为 209.3 毫秒,Clef-flash 只要 38.8 毫秒,而 Jev 是 524.1 毫秒;p95 延迟 Clef-flash 为 122.4 毫秒,不到 Jev 的四分之一。第二是多模态:Clef 带视觉编码器,能直接分类图片内容,Jev 目前只做文本;上下文窗口给到 64k,是 Jev 的两倍。第三是开源:两个模型权重全部公开,Apache 2.0 协议,可本地部署——在 Jev、OpenAI Decisions API、Cloudflare Clef 这一波决策模型里,它是唯一开源权重的一家。

准确度上,Cloudflare 贴出了 Jev Decision Index 的对比:在 BANKING77 上 Clef 的 macro-F1 为 94.20、Clef-flash 90.93,Jev 是 79.74;在 BFCL 上两款分别达到 98.47 和 98.76。不过 When2Call 和 BRIGHT 两项仍是 Jev 占优,说明没有哪家通吃所有场景。自家内部已经在用:威胁情报团队用 Clef 给域名分类,一个网站抓取、渲染加分类 2.2 秒完成,而最快的通用 LLM gpt-oss-120b 同样流程要 4.7 秒,还只返回两个分类。

附带的 RL 微调平台

和模型一起发布的还有一套强化学习微调服务:先由 Cloudflare 的前线部署工程师团队以 hands-on 方式帮客户调优,之后再做成自助平台。链路复用了 Cloudflare 已有的 AI 平台组件——AI Gateway 把线上 AI 流量沉淀成数据集,Workers AI 跑 rollouts,Containers 做 RL 沙箱评分回放,新的 Trainer 更新权重,训好的模型再 redeploy 回 Workers AI。

这个时间点很微妙:TypeSafe Jev 在 9 月 15 日引爆话题,OpenAI 在 9 月 29 日推出 Decisions API(有限预览),Cloudflare 在 10 月 1 日跟进。两周内三家入场,说明“agent 做决策”这个环节正在从“调 LLM 碰运气”变成独立的基础设施层。对开发者的实际意义是:客服分流、工单路由、内容审核、升级判断这类“先分类再行动”的场景,现在有了一条更快更便宜的专用通道,而且因为 API 兼容 Jev,迁移成本很低。

边界也要说清楚:上面的基准成绩全部来自 Cloudflare 自测,独立验证还要再看;决策模型只负责“判断”,判断之后“做什么”仍然要靠 LLM 或业务代码。把它放进 agent 热路径之前,先在自己的数据上跑一遍校准。

推荐工具

NVIDIA Chat with RTX AI聊天 Chat with RTX 是 NVIDIA 面向 RTX 电脑的本地 AI 聊天工具,可围绕本地文档和视频资料做问答,适合重视隐私、离线检索并具备硬件条件的用户更适合资料不便上传云 HuggingChat AI聊天 HuggingChat 是 Hugging Face 的开源模型聊天应用,支持 Omni 自动选模型,也可手动选社区开放模型对话。它适合体验开源模型、技术探索和问答,结果可能不稳定,重要内容需复核。 纳米AI搜索 AI搜索 纳米AI 是 360 旗下 AI 搜索和智能体入口,支持文字、语音、拍照提问、多模型协作与内容创作,适合中文用户做日常搜索、学习问答、移动查询、热点追踪、生活决策、知识整理和轻量创作。 Qwen Chat(通义千问) AI聊天 Qwen Chat 是Qwen 大模型聊天助手,支持Qwen 模型聊天、写作和编程问答,适合中文用户和开发者完成 AI 对话、资料问答和任务协作,适合上线前核对权限、成本和资料质量。 DuckDuckGo AI Chat AI聊天 DuckDuckGo AI Chat 适合重视隐私的普通用户使用,围绕隐私 AI 聊天、免账户使用和多模型问答提供对话式 AI 支持和任务协作能力,适合上线前核对权限、成本和资料质量。 Goody-2 AI聊天 Goody-2 是以极端安全和伦理对齐为特色的 AI 聊天助手,常用于观察模型拒答边界、内容安全策略、保守输出体验和 AI 风险讨论,更适合作为安全边界样本使用前应理解它偏实验性质,不适合。