Cloudflare Clef 决策模型:开源、支持视觉、可基于强化学习微调

TL;DR

Clef 和 Clef-flash 是 Cloudflare 训练的开源决策模型,其在 Jev 决策指数上的表现超越了 Typesafe 的 Jev,运行速度最高快 10 倍,支持图像输入,并可通过全新的基于强化学习的服务进行微调。


什么是决策模型?

决策模型接收结构化输入(例如支持工单、URL),并返回带有相关概率的类型化分类结果。输出可直接被代码消费,用于工单路由、触发升级或转交人工处理。与通用大语言模型不同,决策模型专为确定性外观、有界输出和低延迟设计。

"决策模型通过特定概率帮助代理决定如何行动。" – Cloudflare 博客

Cloudflare 的示例用例

  • 输入:通过 Browser Run 获取的网站域名。
  • 输出:例如 95% 为时尚类,85% 为电商类,<1% 为钓鱼类的概率。
  • 延迟:2.2 秒,相比最快的大语言模型(gpt-oss-120b)在同一工作流中为 4.7 秒。

Clef 与其他决策模型的区别

特性 Clef Clef-flash Jev (Typesafe)
基础模型 Qwen-3.8-27B(冻结) Qwen-3.8-9B(冻结) 专有
视觉编码器 ✅(图像分类) ✅ ❌
上下文窗口 64k 标记 64k 标记 32k 标记
延迟(中位数) 209 毫秒 38.8 毫秒 524 毫秒
p95 延迟 238 毫秒 122 毫秒 536 毫秒
基准领先者 在 43 项评估中 Jev 决策指数得分最高 在速度关键任务上接近最先进水平 竞争性但通常较低

Clef 的视觉编码器使其成为首个能够分类视觉内容的非生成式决策模型,这是 Jev 所不具备的能力。更大的上下文窗口允许用户在不截断的情况下提供更多信息(例如更长的日志)。

基准性能

Clef 在公开的 Jev 决策指数 排行榜上领先。部分得分(越高越好):

  • BFCL case exact – 98.47%(Clef) vs 95.75%(Jev)
  • API-Bank accuracy – 93.11% vs 88.19%
  • BANKING77 macro-F1 – 94.20% vs 79.74%

在 Typesafe 工作流套件 上,Clef-flash 在发票处理(64.7% vs 61.8%)和代理追踪可观测性(71.6% vs 68.5%)方面优于 Jev。

"这些模型更智能、更快,且完全兼容 Jev API,因此你可以轻松地实验这些托管模型。" – Cloudflare 博客

支持高速的架构

  1. 两阶段注意力路由 – 模型首先运行 Qwen 的 预填充仅 通路,然后并行评分每个模式选择。无需自回归标记生成。
  2. 选项特定证据提取 – 每个可能的答案提取相关上下文,与其他字段交叉注意力,最终获得概率评分。
  3. 低秩适配器 – 在冻结的 Qwen 权重之上训练秩为 256 的适配器,实现快速后训练,无需完整模型微调。
  4. 损失函数 – 对正确模式输出使用标签平滑交叉熵,结合 Brier 损失以实现校准概率。
  5. 用于校准决策的强化学习(RLCD) – 对接近成功的案例给予部分奖励,惩罚分布偏移,同时提升准确率和校准度。

非自回归设计消除了逐标记生成的瓶颈,相比同类基于大语言模型的分类器,延迟最高可降低 10 倍。

在 Workers AI 上托管

Clef 模型通过 Workers AI 部署在 Cloudflare 的边缘 GPU 上,提供:

  • 毫秒级以下的网络往返时间。
  • 可将模型置于请求处理的热路径中。
  • 兼容 Jev 模式的简单 HTTP API。

示例 curl 请求(摘录):

curl https://api.cloudflare.com/client/v4/accounts/$CLOUDFLARE_ACCOUNT_ID/ai/run/@cf/cloudflare/clef \
  -X POST -H "Authorization: Bearer $CLOUDFLARE_AUTH_TOKEN" \
  -d '{
    "model": "clef",
    "state": "Checkout has been failing for every customer for the last hour.",
    "questions": { ... }
  }'

开源发布

"开源权重,而非开源。权重采用宽松许可,但数据和训练流程未公开,无法从其专有 Qwen 起点复现。" – HN 评论,buildbuildbuild

通过强化学习服务进行微调

Cloudflare 推出 强化学习微调平台,允许客户将 Clef 适配到特定领域任务(例如信任与安全分类、机器人识别)。该工作流利用现有的 Cloudflare 原语:

  1. AI Gateway – 捕获请求/响应对以构建数据集。
  2. Workers AI – 对基础 Clef 模型生成 rollout。
  3. 容器 – 提供强化学习沙箱用于评分和回放。
  4. 训练器 – 使用 RLCD 目标更新模型权重。
  5. 自定义模型部署 – 将微调后的模型重新部署到 Workers AI。

该服务最初以 协作伙伴 形式提供,由 Forward-Deployed Engineer(FDE)团队支持,后续计划推出自助平台。

Hacker News 社区反应

评论主题 代表性引述
性能 vs 成本 "定价为每百万输入标记 0.24 美元,约为 Jev 的 6 倍。Clef-flash 为每百万 0.09 美元,更具竞争力。" – ssiddharth
开源担忧 "开源权重,而非开源。数据和训练流程未公开。" – buildbuildbuild
视觉能力 "支持图像输入。很棒!" – swingboy
速度与准确率权衡 "Clef-flash 更快但有时过度升级;Clef 更准确但更慢。" – agrippanux
实际应用价值 "如果 Clef 能在 2 秒内完成域名分类,我就不必为未分类网站提交支持工单了。" – johnbatch
对新颖性的怀疑 "许多团队在 Jev 发布后几天内就构建了决策模型?这个概念是否已成熟?" – warkdarrior
校准性质疑 "未提及校准。难道只是另一个大语言模型微调?" – zwaps

总体情绪对开源发布和速度提升持积极态度,但评论者指出定价较高、缺乏可复现的训练流程,以及需要微调才能达到生产级准确率。

何时使用 Clef 而非完整大语言模型

  • 使用 Clef 当你需要:
    • 结构化、基于概率的决策。
    • 边缘位置的低延迟(低于 200 毫秒)。
    • 支持视觉的分类能力。
    • 为下游自动化提供确定性外观的输出。
  • 使用生成式大语言模型 当你需要:
    • 自由格式文本生成、推理或工具调用编排。
    • 复杂的多轮对话。
    • 在可接受几百毫秒开销的情况下使用。

快速入门

  1. 尝试托管端点 – 参考上述 API 示例。
  2. 下载权重 – git clone https://huggingface.co/Cloudflare/clef。
  3. 本地运行 – 使用标准的 transformers 或 vLLM 流水线(模型期望 Jev 兼容模式)。
  4. 探索实时基准演示 – https://clef-evals.workers-ai-mle.workers.dev/。
  5. 联系 Cloudflare 进行微调 – 填写博客文章中链接的兴趣表单。

未来展望

Clef 证明了决策导向模型既可以是 高质量 的,也可以是 边缘就绪 的,在重型大语言模型和传统分类器之间开辟了新空间。即将推出的自助式强化学习微调平台,将进一步加速采用,使组织能够在不离开 Cloudflare 基础设施的前提下,将模型定制到专有领域。

如果你正在构建需要快速、结构化决策的代理工作流——尤其是涉及视觉输入——Clef 和 Clef-flash 为 Jev 和通用大语言模型提供了一个有吸引力的开源替代方案。

Sources

相关