Cloudflare 开源 Clef 决策模型:不生成文本只返回概率,AI Agent 路由怎么降本?
Cloudflare 发布 Clef 和 Clef-flash,首批决策模型(Decision Model)。与 LLM 不同,Clef 不生成自由文本,而是对固定问题集返回类型化概率。基于 Qwen3.8-27B 和 Qwen3.5-9B,Apache 2.0 开源,延迟低至 38.8ms,Workers AI 上 $0.09-0.24/M tokens。
核心结论
2026 年 10 月 1 日,Cloudflare 发布 Clef 和 Clef-flash——这是 Workers AI 团队训练的首批模型,也是首批开源决策模型(Decision Model)。与 LLM 逐 token 生成自由文本不同,决策模型读取输入状态和一组类型化问题,对每个允许的答案返回概率值,无需解析。两个模型均以 Apache 2.0 许可证开源,兼容 TypeSafe AI 的 Jev API,权重已在 Hugging Face 上发布。
决策模型 vs. LLM:核心差异
LLM 的输出是 token 序列,仍需后处理解析。决策模型只回答固定问题集,直接返回概率:
Clef 支持三种问题类型:
noul(是/否): 返回「是」的概率choice(多选一): 从命名选项中选一个,返回每个选项的概率和置信度score(评分): 按有序评分标准评分,返回概率加权分数
在 Workers AI 上,单次请求最多携带 64 个问题和 4 张图片。
模型规格
| 特性 | Clef | Clef-flash |
|---|---|---|
| 参数量 | 27B | 9B |
| 骨干网络 | Qwen3.8-27B | Qwen3.5-9B |
| 许可证 | Apache 2.0 | Apache 2.0 |
| 上下文窗口 | 65,536 tokens | 65,536 tokens |
| 中位延迟 | 209.3ms | 38.8ms |
| 托管价格(输入) | $0.24/M tokens | $0.09/M tokens |
| 图片输入 | 支持 | 支持 |
对比 Jev(TypeSafe AI 的 System One 模型,9月15日发布):Jev 中位延迟 524.1ms,上下文 32K tokens,不公开权重,$0.042/M tokens。Clef-flash 在延迟上快 13.5 倍。
技术架构
两阶段推理流程
- 骨干网络前缀预填充: Qwen 骨干网络对输入状态和问题做单次 prefill-only 前向传播(不生成 token)
- 联合模式头(Joint Schema Head): 一个小型 Transformer 读取最终隐藏状态,将证据路由到每个问题,允许字段间交叉注意力,并联合评分所有选项。每个问题通过 softmax 将 logits 转为概率
训练方法
- 冻结骨干网络(Qwen3.8-27B / Qwen3.5-9B)
- 联合优化路由头:rank-256 低秩适配器(LoRA)
- 损失函数:标签平滑交叉熵 + Brier 损失(用于校准)
- 次要目标:RLCD(Reinforcement Learning for Calibrated Decisions),对相邻序数选择给予部分分数
基准测试:Clef 在哪里赢、在哪里输
Cloudflare 从 Decision Index 0.2.1 套件的 10 项基准中筛选,Clef 系列在 7 项上得分最高:
| 基准 | Clef | Jev |
|---|---|---|
| BANKING77(macro-F1) | 94.20 | 79.74 |
| CLINC150+OOS(macro-F1) | 97.43 | 89.27 |
| 家电分类(case exact) | 97.73(Clef-flash) | 52.27 |
但 Jev 在知识密集型任务上保持明显领先:
| 基准 | Jev | Clef |
|---|---|---|
| GPQA Diamond | 78.3 | 48.0 |
| MMLU-Pro | 82.7 | 65.9 |
| BBH | 92.9 | 73.7 |
在 TypeSafe 自身的工作流评估中,Clef 在 4 个领域中的 3 个小幅领先 Jev:发票处理(64.7 vs 61.8)、客服(76.3 vs 76.0)、安全事件(62.9 vs 61.7)。Jev 在 Agent 轨迹可观测性上领先(71.6 vs 68.5)。
在 Cloudflare 内部的威胁情报工作流中,Clef 对一个域名分类耗时 2.2 秒,而 gpt-oss-120b 需要 4.7 秒。
部署与微调
部署方式
- Workers AI 绑定(
env.AI.run()) - REST API
- AI Gateway
- 自托管:模型卡标注在单张 H200 上测试 BF16 权重
RL 微调服务
Cloudflare 同时宣布了一项强化学习微调服务,用于在私有数据上调优 Clef:
- 首先面向 Cloudflare 的 forward-deployed engineers
- 后续将开放自助服务平台
- 流水线整合 AI Gateway、Workers AI、Containers 和新的 Trainer 组件
- 可通过设计合作伙伴表单申请
决策模型对 AI Agent 的意义
决策模型解决了 LLM 在确定性任务中的根本问题——非确定性输出。对于 AI Agent 架构,这意味着:
- Agent 路由: 用决策模型判断请求应路由到哪个工具或 Agent,比调用完整 LLM 更快更便宜
- 工具选择: 在调用工具前,用决策模型验证参数是否 grounded
- 护栏(Guardrails): 在 LLM 执行动作前,用决策模型做门控——「这个工具调用是否有依据?」
- 成本降低: 将高频分类决策从 LLM 调用迁移到决策模型,显著降低推理成本
- 延迟优化: Clef-flash 38.8ms 的延迟使实时 Agent 门控成为可能
竞争格局
Clef 进入的是一个正在形成的「System One 模型」市场:
- Jev(TypeSafe AI,9月15日):闭源,$0.042/M tokens
- Kev-9B(Jared Palmer):Apache 2.0,9B + 45.4M LoRA
- Laya(Convai Innovations):Apache 2.0,421M 参数
- Clef/Clef-flash(Cloudflare):Apache 2.0,27B/9B
Cloudflare 的优势在于:全球边缘网络部署(335+ 城市)、Workers AI 原生集成、RL 微调服务,以及与 Jev API 兼容的迁移路径(只需改端点和模型名)。
结论
Cloudflare Clef 代表了 AI Agent 基础设施的新范式——不是所有决策都需要一个完整 LLM。决策模型以更低延迟、更低成本、更高确定性处理高频路由和分类任务,让 LLM 专注于真正需要生成和推理的部分。Apache 2.0 开源、Workers AI 集成和 RL 微调服务的组合,使 Clef 成为 AI Agent 开发者降低推理成本和提升响应速度的有力工具。但需要注意:所有基准数据均为厂商自报,尚无独立复现。
主题中心
AI Agent 教程与工作流指南
比新闻更常青:按步骤搭建编程 Agent、内容流水线与 n8n 自动化,并链接到真实赚钱案例。
进入「AI Agent 教程与工作流指南」 →赚钱视角
这个趋势怎么赚钱?
WayToClawEarn 的差异在可验证的赚钱案例,而不只是资讯。从这些复盘开始:
浏览全部案例 →