Cloudflare Clef 决策模型:开源、支持视觉、可基于强化学习微调
TL;DR
Clef 和 Clef-flash 是 Cloudflare 训练的开源决策模型,其在 Jev 决策指数上的表现超越了 Typesafe 的 Jev,运行速度最高快 10 倍,支持图像输入,并可通过全新的基于强化学习的服务进行微调。
什么是决策模型?
决策模型接收结构化输入(例如支持工单、URL),并返回带有相关概率的类型化分类结果。输出可直接被代码消费,用于工单路由、触发升级或转交人工处理。与通用大语言模型不同,决策模型专为确定性外观、有界输出和低延迟设计。
"决策模型通过特定概率帮助代理决定如何行动。" – Cloudflare 博客
Cloudflare 的示例用例
- 输入:通过 Browser Run 获取的网站域名。
- 输出:例如 95% 为时尚类,85% 为电商类,<1% 为钓鱼类的概率。
- 延迟:2.2 秒,相比最快的大语言模型(gpt-oss-120b)在同一工作流中为 4.7 秒。
Clef 与其他决策模型的区别
| 特性 | Clef | Clef-flash | Jev (Typesafe) |
|---|---|---|---|
| 基础模型 | Qwen-3.8-27B(冻结) | Qwen-3.8-9B(冻结) | 专有 |
| 视觉编码器 | ✅(图像分类) | ✅ | ❌ |
| 上下文窗口 | 64k 标记 | 64k 标记 | 32k 标记 |
| 延迟(中位数) | 209 毫秒 | 38.8 毫秒 | 524 毫秒 |
| p95 延迟 | 238 毫秒 | 122 毫秒 | 536 毫秒 |
| 基准领先者 | 在 43 项评估中 Jev 决策指数得分最高 | 在速度关键任务上接近最先进水平 | 竞争性但通常较低 |
Clef 的视觉编码器使其成为首个能够分类视觉内容的非生成式决策模型,这是 Jev 所不具备的能力。更大的上下文窗口允许用户在不截断的情况下提供更多信息(例如更长的日志)。
基准性能
Clef 在公开的 Jev 决策指数 排行榜上领先。部分得分(越高越好):
- BFCL case exact – 98.47%(Clef) vs 95.75%(Jev)
- API-Bank accuracy – 93.11% vs 88.19%
- BANKING77 macro-F1 – 94.20% vs 79.74%
在 Typesafe 工作流套件 上,Clef-flash 在发票处理(64.7% vs 61.8%)和代理追踪可观测性(71.6% vs 68.5%)方面优于 Jev。
"这些模型更智能、更快,且完全兼容 Jev API,因此你可以轻松地实验这些托管模型。" – Cloudflare 博客
支持高速的架构
- 两阶段注意力路由 – 模型首先运行 Qwen 的 预填充仅 通路,然后并行评分每个模式选择。无需自回归标记生成。
- 选项特定证据提取 – 每个可能的答案提取相关上下文,与其他字段交叉注意力,最终获得概率评分。
- 低秩适配器 – 在冻结的 Qwen 权重之上训练秩为 256 的适配器,实现快速后训练,无需完整模型微调。
- 损失函数 – 对正确模式输出使用标签平滑交叉熵,结合 Brier 损失以实现校准概率。
- 用于校准决策的强化学习(RLCD) – 对接近成功的案例给予部分奖励,惩罚分布偏移,同时提升准确率和校准度。
非自回归设计消除了逐标记生成的瓶颈,相比同类基于大语言模型的分类器,延迟最高可降低 10 倍。
在 Workers AI 上托管
Clef 模型通过 Workers AI 部署在 Cloudflare 的边缘 GPU 上,提供:
- 毫秒级以下的网络往返时间。
- 可将模型置于请求处理的热路径中。
- 兼容 Jev 模式的简单 HTTP API。
示例 curl 请求(摘录):
curl https://api.cloudflare.com/client/v4/accounts/$CLOUDFLARE_ACCOUNT_ID/ai/run/@cf/cloudflare/clef \
-X POST -H "Authorization: Bearer $CLOUDFLARE_AUTH_TOKEN" \
-d '{
"model": "clef",
"state": "Checkout has been failing for every customer for the last hour.",
"questions": { ... }
}'
开源发布
- 仓库: https://huggingface.co/Cloudflare/clef(Apache 2.0)
- 提供 Clef 和 Clef-flash 的权重。
- 数据和训练流程 未 开源;仅最终模型权重以宽松许可证发布。
"开源权重,而非开源。权重采用宽松许可,但数据和训练流程未公开,无法从其专有 Qwen 起点复现。" – HN 评论,buildbuildbuild
通过强化学习服务进行微调
Cloudflare 推出 强化学习微调平台,允许客户将 Clef 适配到特定领域任务(例如信任与安全分类、机器人识别)。该工作流利用现有的 Cloudflare 原语:
- AI Gateway – 捕获请求/响应对以构建数据集。
- Workers AI – 对基础 Clef 模型生成 rollout。
- 容器 – 提供强化学习沙箱用于评分和回放。
- 训练器 – 使用 RLCD 目标更新模型权重。
- 自定义模型部署 – 将微调后的模型重新部署到 Workers AI。
该服务最初以 协作伙伴 形式提供,由 Forward-Deployed Engineer(FDE)团队支持,后续计划推出自助平台。
Hacker News 社区反应
| 评论主题 | 代表性引述 |
|---|---|
| 性能 vs 成本 | "定价为每百万输入标记 0.24 美元,约为 Jev 的 6 倍。Clef-flash 为每百万 0.09 美元,更具竞争力。" – ssiddharth |
| 开源担忧 | "开源权重,而非开源。数据和训练流程未公开。" – buildbuildbuild |
| 视觉能力 | "支持图像输入。很棒!" – swingboy |
| 速度与准确率权衡 | "Clef-flash 更快但有时过度升级;Clef 更准确但更慢。" – agrippanux |
| 实际应用价值 | "如果 Clef 能在 2 秒内完成域名分类,我就不必为未分类网站提交支持工单了。" – johnbatch |
| 对新颖性的怀疑 | "许多团队在 Jev 发布后几天内就构建了决策模型?这个概念是否已成熟?" – warkdarrior |
| 校准性质疑 | "未提及校准。难道只是另一个大语言模型微调?" – zwaps |
总体情绪对开源发布和速度提升持积极态度,但评论者指出定价较高、缺乏可复现的训练流程,以及需要微调才能达到生产级准确率。
何时使用 Clef 而非完整大语言模型
- 使用 Clef 当你需要:
- 结构化、基于概率的决策。
- 边缘位置的低延迟(低于 200 毫秒)。
- 支持视觉的分类能力。
- 为下游自动化提供确定性外观的输出。
- 使用生成式大语言模型 当你需要:
- 自由格式文本生成、推理或工具调用编排。
- 复杂的多轮对话。
- 在可接受几百毫秒开销的情况下使用。
快速入门
- 尝试托管端点 – 参考上述 API 示例。
- 下载权重 –
git clone https://huggingface.co/Cloudflare/clef。 - 本地运行 – 使用标准的
transformers或vLLM流水线(模型期望 Jev 兼容模式)。 - 探索实时基准演示 – https://clef-evals.workers-ai-mle.workers.dev/。
- 联系 Cloudflare 进行微调 – 填写博客文章中链接的兴趣表单。
未来展望
Clef 证明了决策导向模型既可以是 高质量 的,也可以是 边缘就绪 的,在重型大语言模型和传统分类器之间开辟了新空间。即将推出的自助式强化学习微调平台,将进一步加速采用,使组织能够在不离开 Cloudflare 基础设施的前提下,将模型定制到专有领域。
如果你正在构建需要快速、结构化决策的代理工作流——尤其是涉及视觉输入——Clef 和 Clef-flash 为 Jev 和通用大语言模型提供了一个有吸引力的开源替代方案。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch