Cloudflare Clef 決策模型:開源、具視覺能力,且支援 RL 微調

簡要重點

Clef 和 Clef‑flash 是 Cloudflare 訓練的開源決策模型,其在 Jev 決策指數上的表現超越 Typesafe 的 Jev,運行速度最快可達 10 倍,支援圖像輸入,並可透過新推出的基於強化學習的服務進行微調。


什麼是決策模型?

決策模型接收結構化輸入(例如支援工單、URL),並回傳帶有相關機率的類型分類。輸出可直接由程式碼消費,用於工單路由、觸發升級或交由人工處理。與通用型大語言模型不同,決策模型專為產生可預測、範圍有限的輸出與低延遲而設計。

"決策模型根據特定機率進行分類,以協助代理決定如何行動。" – Cloudflare 博客

Cloudflare 的實際應用範例

  • 輸入:使用 Browser Run 取得的網站網域。
  • 輸出:機率如 95 % 為時尚、85 % 為電商、<1 % 為釣魚網站。
  • 延遲:2.2 秒,遠低於相同工作流程中最快的大語言模型(gpt‑oss‑120b)的 4.7 秒。

Clef 與其他決策模型的差異

特性 Clef Clef‑flash Jev (Typesafe)
基礎模型 Qwen‑3.8‑27B(凍結) Qwen‑3.8‑9B(凍結) 專有
視覺編碼器 ✅(圖像分類) ✅ ❌
上下文視窗 64 k tokens 64 k tokens 32 k tokens
延遲(中位數) 209 ms 38.8 ms 524 ms
p95 延遲 238 ms 122 ms 536 ms
基準領先者 在 43 個評估中於 Jev 決策指數上取得最高分 在速度關鍵任務上接近最尖端表現 具競爭力但通常較低

Clef 的視覺編碼器使其成為首個能分類視覺內容的非生成式決策模型,這項能力 Jev 缺乏。更大的上下文視窗讓使用者能提供更完整的狀態(例如更長的記錄)而無需截斷。

基準表現

Clef 在公開的 Jev 決策指數 排行榜上領先。部分得分(越高越好):

  • BFCL case exact – 98.47 %(Clef)對 95.75 %(Jev)
  • API‑Bank accuracy – 93.11 % 對 88.19 %
  • BANKING77 macro‑F1 – 94.20 % 對 79.74 %

在 Typesafe 工作流程套件 上,Clef‑flash 在發票處理(64.7 % 對 61.8 %)與代理追蹤可觀察性(71.6 % 對 68.5 %)上均超越 Jev。

"這些模型更聰明、更快,且完全相容 Jev API,因此你可以輕鬆地試用這些託管模型。" – Cloudflare 博客

支援高速的架構

  1. 兩階段注意力路由 – 模型首先執行 Qwen 的 預填 單一階段,然後並行評估每個架構選擇。無需自回歸式 token 生成。
  2. 選項特定的證據提取 – 每個可能的答案會提取相關上下文,與其他欄位交叉注意力,最後獲得機率分數。
  3. 低秩適配器 – 在凍結的 Qwen 權重上訓練秩為 256 的適配器,實現快速後訓練,無需完整模型微調。
  4. 損失函數 – 對正確架構輸出使用標籤平滑交叉熵,並結合 Brier 損失以確保機率校準。
  5. 強化學習校準決策(RLCD) – 對接近成功的案例給予部分獎勵,懲罰分佈偏移,同時提升準確率與校準度。

非自回歸設計消除了逐 token 生成的瓶頸,使延遲最高可比類似 LLM 的分類器降低 10 倍。

在 Workers AI 上託管

Clef 模型透過 Workers AI 部署於 Cloudflare 的邊緣 GPU,提供:

  • 毫秒級以下的網路往返時間。
  • 可將模型置於請求處理的熱路徑中。
  • 簡單的 HTTP API,與 Jev 架構相容。

範例 curl 請求(摘錄):

curl https://api.cloudflare.com/client/v4/accounts/$CLOUDFLARE_ACCOUNT_ID/ai/run/@cf/cloudflare/clef \
  -X POST -H "Authorization: Bearer $CLOUDFLARE_AUTH_TOKEN" \
  -d '{
    "model": "clef",
    "state": "Checkout has been failing for every customer for the last hour.",
    "questions": { ... }
  }'

開源釋出

"開源權重,非開源。權重採寬鬆授權,但資料與訓練流程未公開,無法從其專有 Qwen 起點重現。" – HN 評論,buildbuildbuild

透過 RL 服務進行微調

Cloudflare 推出 強化學習微調平台,讓客戶可將 Clef 適用於特定領域任務(例如信任與安全分類、機器人分類)。此工作流程利用現有的 Cloudflare 原語:

  1. AI Gateway – 捕捉請求/回應對,建立資料集。
  2. Workers AI – 對基礎 Clef 模型進行模擬推演。
  3. 容器 – 提供 RL 砂箱以進行評分與重播。
  4. 訓練器 – 使用 RLCD 目標更新模型權重。
  5. 自備模型部署 – 將微調後的模型重新部署於 Workers AI。

此服務初期為 需人工協助的夥伴方案,由 Forward‑Deployed Engineer(FDE)團隊提供,後續將推出自助平台。

社群在 Hacker News 上的反應

評論主題 代表性引言
效能 vs 成本 "定價為 $0.24 / 百萬輸入 token,約為 Jev 的 6 倍。Clef‑flash 則為 $0.09 / M,更具競爭力。" – ssiddharth
開源疑慮 "開源權重,非開源。資料與訓練流程未公開。" – buildbuildbuild
視覺能力 "支援圖像輸入。很棒!" – swingboy
速度 vs 準確度的權衡 "Clef‑flash 更快,但有時會過度升級;Clef 更準確但較慢。" – agrippanux
實際應用價值 "如果 Clef 能在 2 秒內決定網域分類,我就不必為未分類的網站提交支援工單。" – johnbatch
對新穎性的懷疑 "許多團隊在 Jev 發布後幾天內就建好了決策模型?這個概念是否已成熟?" – warkdarrior
校準的疑慮 "未提及校準。難道只是另一個 LLM 微調?" – zwaps

整體評價對開源釋出與速度提升持正面態度,但評論者指出定價較高、缺乏可重現的訓練流程,且需微調才能達到生產級準確度。

何時使用 Clef 而非完整 LLM

  • 使用 Clef 當你需要:
    • 結構化、基於機率的決策。
    • 在邊緣位置達到低延遲(低於 200 ms)。
    • 支援視覺分類。
    • 為下游自動化產生可預測的輸出。
  • 使用生成式 LLM 當你需要:
    • 自由格式的文字生成、推理或工具調度。
    • 複雜的多輪對話。
    • 在幾百毫秒的額外開銷可接受的情況下。

開始使用

  1. 試用託管端點 – 參照上方 API 範例。
  2. 下載權重 – git clone https://huggingface.co/Cloudflare/clef。
  3. 在本地執行 – 使用標準的 transformers 或 vLLM 流程(模型預期使用 Jev 相容架構)。
  4. 探索即時基準演示 – https://clef-evals.workers-ai-mle.workers.dev/。
  5. 聯絡 Cloudflare 進行微調 – 填寫部落格文章中連結的興趣表單。

未來展望

Clef 展示了決策導向模型可同時具備 高品質 與 邊緣就緒 的特性,在重型 LLM 與傳統分類器之間開闢出新領域。即將推出的自助式 RL 微調平台,將進一步加速採用,讓組織能在不離開 Cloudflare 基礎設施的情況下,將模型客製化至專有領域。

如果你正在建構需要快速、結構化決策的代理工作流程——特別是包含視覺輸入的情境——Clef 和 Clef‑flash 提供了一個強大且開源的替代方案,可取代 Jev 與通用 LLM。

Sources

相關