WayToClawEarn
中等影响Cloudflare Blog

Cloudflare 开源 Clef 决策模型:不生成文本只返回概率,AI Agent 路由怎么降本?

Cloudflare 发布 Clef 和 Clef-flash,首批决策模型(Decision Model)。与 LLM 不同,Clef 不生成自由文本,而是对固定问题集返回类型化概率。基于 Qwen3.8-27B 和 Qwen3.5-9B,Apache 2.0 开源,延迟低至 38.8ms,Workers AI 上 $0.09-0.24/M tokens。

Edisen Lu · WayToClawEarn来源 Cloudflare Blog发布 2026年10月2日

基于公开来源复核 · AI 辅助整理,编辑把关。 内容方法 · 原始来源

公开来源汇编

综合公开帖文/文档整理。一手主张请优先核对原始来源。

我们如何审核内容 · 一手来源 · Cloudflare Blog

核心结论

2026 年 10 月 1 日,Cloudflare 发布 Clef 和 Clef-flash——这是 Workers AI 团队训练的首批模型,也是首批开源决策模型(Decision Model)。与 LLM 逐 token 生成自由文本不同,决策模型读取输入状态和一组类型化问题,对每个允许的答案返回概率值,无需解析。两个模型均以 Apache 2.0 许可证开源,兼容 TypeSafe AI 的 Jev API,权重已在 Hugging Face 上发布。

决策模型 vs. LLM:核心差异

LLM 的输出是 token 序列,仍需后处理解析。决策模型只回答固定问题集,直接返回概率:

Clef 支持三种问题类型:

  1. noul(是/否): 返回「是」的概率
  2. choice(多选一): 从命名选项中选一个,返回每个选项的概率和置信度
  3. score(评分): 按有序评分标准评分,返回概率加权分数

在 Workers AI 上,单次请求最多携带 64 个问题和 4 张图片。

模型规格

特性ClefClef-flash
参数量27B9B
骨干网络Qwen3.8-27BQwen3.5-9B
许可证Apache 2.0Apache 2.0
上下文窗口65,536 tokens65,536 tokens
中位延迟209.3ms38.8ms
托管价格(输入)$0.24/M tokens$0.09/M tokens
图片输入支持支持

对比 Jev(TypeSafe AI 的 System One 模型,9月15日发布):Jev 中位延迟 524.1ms,上下文 32K tokens,不公开权重,$0.042/M tokens。Clef-flash 在延迟上快 13.5 倍。

技术架构

两阶段推理流程

  1. 骨干网络前缀预填充: Qwen 骨干网络对输入状态和问题做单次 prefill-only 前向传播(不生成 token)
  2. 联合模式头(Joint Schema Head): 一个小型 Transformer 读取最终隐藏状态,将证据路由到每个问题,允许字段间交叉注意力,并联合评分所有选项。每个问题通过 softmax 将 logits 转为概率

训练方法

  • 冻结骨干网络(Qwen3.8-27B / Qwen3.5-9B)
  • 联合优化路由头:rank-256 低秩适配器(LoRA)
  • 损失函数:标签平滑交叉熵 + Brier 损失(用于校准)
  • 次要目标:RLCD(Reinforcement Learning for Calibrated Decisions),对相邻序数选择给予部分分数

基准测试:Clef 在哪里赢、在哪里输

Cloudflare 从 Decision Index 0.2.1 套件的 10 项基准中筛选,Clef 系列在 7 项上得分最高:

基准ClefJev
BANKING77(macro-F1)94.2079.74
CLINC150+OOS(macro-F1)97.4389.27
家电分类(case exact)97.73(Clef-flash)52.27

但 Jev 在知识密集型任务上保持明显领先:

基准JevClef
GPQA Diamond78.348.0
MMLU-Pro82.765.9
BBH92.973.7

在 TypeSafe 自身的工作流评估中,Clef 在 4 个领域中的 3 个小幅领先 Jev:发票处理(64.7 vs 61.8)、客服(76.3 vs 76.0)、安全事件(62.9 vs 61.7)。Jev 在 Agent 轨迹可观测性上领先(71.6 vs 68.5)。

在 Cloudflare 内部的威胁情报工作流中,Clef 对一个域名分类耗时 2.2 秒,而 gpt-oss-120b 需要 4.7 秒。

部署与微调

部署方式

  • Workers AI 绑定(env.AI.run())
  • REST API
  • AI Gateway
  • 自托管:模型卡标注在单张 H200 上测试 BF16 权重

RL 微调服务

Cloudflare 同时宣布了一项强化学习微调服务,用于在私有数据上调优 Clef:

  • 首先面向 Cloudflare 的 forward-deployed engineers
  • 后续将开放自助服务平台
  • 流水线整合 AI Gateway、Workers AI、Containers 和新的 Trainer 组件
  • 可通过设计合作伙伴表单申请

决策模型对 AI Agent 的意义

决策模型解决了 LLM 在确定性任务中的根本问题——非确定性输出。对于 AI Agent 架构,这意味着:

  1. Agent 路由: 用决策模型判断请求应路由到哪个工具或 Agent,比调用完整 LLM 更快更便宜
  2. 工具选择: 在调用工具前,用决策模型验证参数是否 grounded
  3. 护栏(Guardrails): 在 LLM 执行动作前,用决策模型做门控——「这个工具调用是否有依据?」
  4. 成本降低: 将高频分类决策从 LLM 调用迁移到决策模型,显著降低推理成本
  5. 延迟优化: Clef-flash 38.8ms 的延迟使实时 Agent 门控成为可能

竞争格局

Clef 进入的是一个正在形成的「System One 模型」市场:

  • Jev(TypeSafe AI,9月15日):闭源,$0.042/M tokens
  • Kev-9B(Jared Palmer):Apache 2.0,9B + 45.4M LoRA
  • Laya(Convai Innovations):Apache 2.0,421M 参数
  • Clef/Clef-flash(Cloudflare):Apache 2.0,27B/9B

Cloudflare 的优势在于:全球边缘网络部署(335+ 城市)、Workers AI 原生集成、RL 微调服务,以及与 Jev API 兼容的迁移路径(只需改端点和模型名)。

结论

Cloudflare Clef 代表了 AI Agent 基础设施的新范式——不是所有决策都需要一个完整 LLM。决策模型以更低延迟、更低成本、更高确定性处理高频路由和分类任务,让 LLM 专注于真正需要生成和推理的部分。Apache 2.0 开源、Workers AI 集成和 RL 微调服务的组合,使 Clef 成为 AI Agent 开发者降低推理成本和提升响应速度的有力工具。但需要注意:所有基准数据均为厂商自报,尚无独立复现。

CloudflareClefdecision modelopen source AIApache 2.0Workers AIAI agentQwen3.8

查看原文 →

仅供学习参考:案例基于公开来源整理,并可能经 AI 辅助起草、由编辑复核。不构成投资或收益建议,亦不保证结果。
Cloudflare Clef 开源决策模型:不写文本只返回概率,Apache 2.0 怎么用 · WayToClawEarn