Cloudflare Clef 決策模型:開源、具視覺能力,且支援 RL 微調
簡要重點
Clef 和 Clef‑flash 是 Cloudflare 訓練的開源決策模型,其在 Jev 決策指數上的表現超越 Typesafe 的 Jev,運行速度最快可達 10 倍,支援圖像輸入,並可透過新推出的基於強化學習的服務進行微調。
什麼是決策模型?
決策模型接收結構化輸入(例如支援工單、URL),並回傳帶有相關機率的類型分類。輸出可直接由程式碼消費,用於工單路由、觸發升級或交由人工處理。與通用型大語言模型不同,決策模型專為產生可預測、範圍有限的輸出與低延遲而設計。
"決策模型根據特定機率進行分類,以協助代理決定如何行動。" – Cloudflare 博客
Cloudflare 的實際應用範例
- 輸入:使用 Browser Run 取得的網站網域。
- 輸出:機率如 95 % 為時尚、85 % 為電商、<1 % 為釣魚網站。
- 延遲:2.2 秒,遠低於相同工作流程中最快的大語言模型(gpt‑oss‑120b)的 4.7 秒。
Clef 與其他決策模型的差異
| 特性 | Clef | Clef‑flash | Jev (Typesafe) |
|---|---|---|---|
| 基礎模型 | Qwen‑3.8‑27B(凍結) | Qwen‑3.8‑9B(凍結) | 專有 |
| 視覺編碼器 | ✅(圖像分類) | ✅ | ❌ |
| 上下文視窗 | 64 k tokens | 64 k tokens | 32 k tokens |
| 延遲(中位數) | 209 ms | 38.8 ms | 524 ms |
| p95 延遲 | 238 ms | 122 ms | 536 ms |
| 基準領先者 | 在 43 個評估中於 Jev 決策指數上取得最高分 | 在速度關鍵任務上接近最尖端表現 | 具競爭力但通常較低 |
Clef 的視覺編碼器使其成為首個能分類視覺內容的非生成式決策模型,這項能力 Jev 缺乏。更大的上下文視窗讓使用者能提供更完整的狀態(例如更長的記錄)而無需截斷。
基準表現
Clef 在公開的 Jev 決策指數 排行榜上領先。部分得分(越高越好):
- BFCL case exact – 98.47 %(Clef)對 95.75 %(Jev)
- API‑Bank accuracy – 93.11 % 對 88.19 %
- BANKING77 macro‑F1 – 94.20 % 對 79.74 %
在 Typesafe 工作流程套件 上,Clef‑flash 在發票處理(64.7 % 對 61.8 %)與代理追蹤可觀察性(71.6 % 對 68.5 %)上均超越 Jev。
"這些模型更聰明、更快,且完全相容 Jev API,因此你可以輕鬆地試用這些託管模型。" – Cloudflare 博客
支援高速的架構
- 兩階段注意力路由 – 模型首先執行 Qwen 的 預填 單一階段,然後並行評估每個架構選擇。無需自回歸式 token 生成。
- 選項特定的證據提取 – 每個可能的答案會提取相關上下文,與其他欄位交叉注意力,最後獲得機率分數。
- 低秩適配器 – 在凍結的 Qwen 權重上訓練秩為 256 的適配器,實現快速後訓練,無需完整模型微調。
- 損失函數 – 對正確架構輸出使用標籤平滑交叉熵,並結合 Brier 損失以確保機率校準。
- 強化學習校準決策(RLCD) – 對接近成功的案例給予部分獎勵,懲罰分佈偏移,同時提升準確率與校準度。
非自回歸設計消除了逐 token 生成的瓶頸,使延遲最高可比類似 LLM 的分類器降低 10 倍。
在 Workers AI 上託管
Clef 模型透過 Workers AI 部署於 Cloudflare 的邊緣 GPU,提供:
- 毫秒級以下的網路往返時間。
- 可將模型置於請求處理的熱路徑中。
- 簡單的 HTTP API,與 Jev 架構相容。
範例 curl 請求(摘錄):
curl https://api.cloudflare.com/client/v4/accounts/$CLOUDFLARE_ACCOUNT_ID/ai/run/@cf/cloudflare/clef \
-X POST -H "Authorization: Bearer $CLOUDFLARE_AUTH_TOKEN" \
-d '{
"model": "clef",
"state": "Checkout has been failing for every customer for the last hour.",
"questions": { ... }
}'
開源釋出
- 倉儲:https://huggingface.co/Cloudflare/clef(Apache 2.0)
- 提供 Clef 與 Clef‑flash 的權重。
- 資料與訓練流程 未 開源;僅釋出最終模型權重,採用寬鬆授權。
"開源權重,非開源。權重採寬鬆授權,但資料與訓練流程未公開,無法從其專有 Qwen 起點重現。" – HN 評論,buildbuildbuild
透過 RL 服務進行微調
Cloudflare 推出 強化學習微調平台,讓客戶可將 Clef 適用於特定領域任務(例如信任與安全分類、機器人分類)。此工作流程利用現有的 Cloudflare 原語:
- AI Gateway – 捕捉請求/回應對,建立資料集。
- Workers AI – 對基礎 Clef 模型進行模擬推演。
- 容器 – 提供 RL 砂箱以進行評分與重播。
- 訓練器 – 使用 RLCD 目標更新模型權重。
- 自備模型部署 – 將微調後的模型重新部署於 Workers AI。
此服務初期為 需人工協助的夥伴方案,由 Forward‑Deployed Engineer(FDE)團隊提供,後續將推出自助平台。
社群在 Hacker News 上的反應
| 評論主題 | 代表性引言 |
|---|---|
| 效能 vs 成本 | "定價為 $0.24 / 百萬輸入 token,約為 Jev 的 6 倍。Clef‑flash 則為 $0.09 / M,更具競爭力。" – ssiddharth |
| 開源疑慮 | "開源權重,非開源。資料與訓練流程未公開。" – buildbuildbuild |
| 視覺能力 | "支援圖像輸入。很棒!" – swingboy |
| 速度 vs 準確度的權衡 | "Clef‑flash 更快,但有時會過度升級;Clef 更準確但較慢。" – agrippanux |
| 實際應用價值 | "如果 Clef 能在 2 秒內決定網域分類,我就不必為未分類的網站提交支援工單。" – johnbatch |
| 對新穎性的懷疑 | "許多團隊在 Jev 發布後幾天內就建好了決策模型?這個概念是否已成熟?" – warkdarrior |
| 校準的疑慮 | "未提及校準。難道只是另一個 LLM 微調?" – zwaps |
整體評價對開源釋出與速度提升持正面態度,但評論者指出定價較高、缺乏可重現的訓練流程,且需微調才能達到生產級準確度。
何時使用 Clef 而非完整 LLM
- 使用 Clef 當你需要:
- 結構化、基於機率的決策。
- 在邊緣位置達到低延遲(低於 200 ms)。
- 支援視覺分類。
- 為下游自動化產生可預測的輸出。
- 使用生成式 LLM 當你需要:
- 自由格式的文字生成、推理或工具調度。
- 複雜的多輪對話。
- 在幾百毫秒的額外開銷可接受的情況下。
開始使用
- 試用託管端點 – 參照上方 API 範例。
- 下載權重 –
git clone https://huggingface.co/Cloudflare/clef。 - 在本地執行 – 使用標準的
transformers或vLLM流程(模型預期使用 Jev 相容架構)。 - 探索即時基準演示 – https://clef-evals.workers-ai-mle.workers.dev/。
- 聯絡 Cloudflare 進行微調 – 填寫部落格文章中連結的興趣表單。
未來展望
Clef 展示了決策導向模型可同時具備 高品質 與 邊緣就緒 的特性,在重型 LLM 與傳統分類器之間開闢出新領域。即將推出的自助式 RL 微調平台,將進一步加速採用,讓組織能在不離開 Cloudflare 基礎設施的情況下,將模型客製化至專有領域。
如果你正在建構需要快速、結構化決策的代理工作流程——特別是包含視覺輸入的情境——Clef 和 Clef‑flash 提供了一個強大且開源的替代方案,可取代 Jev 與通用 LLM。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch