Cloudflare Clef 決定モデル: オープンソース、ビジョン対応、RLで微調整可能なモデル

TL;DR

Clef と Clef‑flash は Cloudflare が訓練したオープンソースの決定モデルであり、Jev Decision Index で Typesafe の Jev を上回り、最大 10 倍高速に動作し、画像入力をサポートし、新しい RL ベースのサービスで微調整が可能である。


決定モデルとは何か?

決定モデルは構造化された入力(例:サポートチケット、URL)を受け取り、関連する確率付きの型付き分類を返す。出力はコードから直接利用でき、チケットのルーティング、エスカレーションのトリガー、または人間への委任に活用できる。汎用的な LLM とは異なり、決定モデルは決定論的な見た目を持ち、出力の範囲が限定され、低レイテンシを目的として設計されている。

"決定モデルは、特定の確率に基づいて、エージェントがどのように行動するかを判断するための分類を行う。" – Cloudflare ブログ

Cloudflare での例の使用事例

  • 入力: Browser Run で取得したウェブサイトのドメイン。
  • 出力: 95 % ファッション、85 % イーコマース、<1 % フィッシング といった確率。
  • レイテンシ: 同じワークフローで最も速い LLM(gpt‑oss‑120b)の 4.7 s に対して 2.2 s。

Clef が他の決定モデルと異なる点

機能 Clef Clef‑flash Jev (Typesafe)
ベースモデル Qwen‑3.8‑27B (凍結) Qwen‑3.8‑9B (凍結) 専用
ビジョンエンコーダ ✅ (画像分類) ✅ ❌
コンテキストウィンドウ 64 k トークン 64 k トークン 32 k トークン
レイテンシ(中央値) 209 ms 38.8 ms 524 ms
p95 レイテンシ 238 ms 122 ms 536 ms
ベンチマークリーダー 43 の評価で Jev Decision Index で最高スコア 速度が重要なタスクで準最先端 競争力はあるが一般的に低い

Clef のビジョンエンコーダにより、視覚コンテンツを分類できる非生成的決定モデルとして初めての存在となり、Jev にはない機能を備える。より大きなコンテキストウィンドウにより、ユーザーは長時間ログなどより多くの状態情報を提供でき、切り捨てられることなく処理できる。

ベンチマーク性能

Clef は公開されている Jev Decision Index リーダーボードで首位を維持している。選択されたスコア(高いほど良い):

  • BFCL case exact – 98.47 % (Clef) 対 95.75 % (Jev)
  • API‑Bank accuracy – 93.11 % 対 88.19 %
  • BANKING77 macro‑F1 – 94.20 % 対 79.74 %

Typesafe ワークフローセット では、Clef‑flash が Jev を上回り、インボイス処理(64.7 % 対 61.8 %)およびエージェントトレースの可視性(71.6 % 対 68.5 %)で優位性を示した。

"これらのモデルはより知的で高速であり、完全に Jev-API と互換性があるため、ホストされたモデルを簡単に試すことができます。" – Cloudflare ブログ

高速性を実現するアーキテクチャ

  1. 二段階のアテンションルーティング – モデルはまず Qwen の プリフィル専用 パスを実行し、その後各スキーマ選択を並列でスコアリングする。自己回帰的なトークン生成は不要。
  2. オプション固有の証拠抽出 – 各可能な回答は関連するコンテキストを抽出し、他のフィールドとクロスアテンションを行い、最終的に確率スコアを受ける。
  3. 低ランクアダプタ – フリーズされた Qwen 重みの上にランク 256 のアダプタを訓練し、フルモデルの微調整なしに迅速な後訓練が可能。
  4. 損失関数 – 正しいスキーマ出力にラベルスムージング付き交差エントロピーを組み合わせ、確率の校正にはブライア損失を使用。
  5. 校正された意思決定のための強化学習(RLCD) – 近接ミスに対して部分的な評価を提供し、分布シフトをペナルティ化し、精度と校正の両方を向上させる。

自己回帰的でない設計により、トークン単位の生成ボトルネックが解消され、同等の LLM ベースの分類器と比較して最大 10 倍の低レイテンシ を実現している。

Workers AI でのホスティング

Clef モデルは Workers AI を通じて Cloudflare のエッジに配置された GPU にデプロイされており、以下の利点を提供する:

  • ミリ秒未満のネットワークラウンドトリップ時間。
  • リクエスト処理のホットパスにモデルを配置可能。
  • Jev スキーマと互換性のあるシンプルな HTTP API。

例: curl リクエスト(抜粋):

curl https://api.cloudflare.com/client/v4/accounts/$CLOUDFLARE_ACCOUNT_ID/ai/run/@cf/cloudflare/clef \
  -X POST -H "Authorization: Bearer $CLOUDFLARE_AUTH_TOKEN" \
  -d '{
    "model": "clef",
    "state": "Checkout has been failing for every customer for the last hour.",
    "questions": { ... }
  }'

オープンソースリリース

  • リポジトリ: https://huggingface.co/Cloudflare/clef (Apache 2.0)
  • Clef と Clef‑flash の両方の重みが提供される。
  • データとトレーニングパイプラインは 公開されていない;最終的なモデル重みのみが許容的なライセンスでリリースされる。

"オープンソースの重みではなく、オープンソースではない。重みは許容的なライセンスだが、データとトレーニングパイプラインは公開されておらず、独自の Qwen から再現することはできない。" – HN コメント by buildbuildbuild

RL サービスによる微調整

Cloudflare は、顧客が Clef をドメイン固有のタスク(例:信頼性と安全のトリアージ、ボット分類)に適応できるようにする 強化学習による微調整プラットフォーム を導入した。このワークフローは既存の Cloudflare プリミティブを活用する:

  1. AI Gateway – リクエスト/レスポンスペアを収集してデータセットを構築。
  2. Workers AI – 基底 Clef モデルに対してロールアウトを生成。
  3. コンテナ – スコアリングとリプレイ用の RL サンドボックスを提供。
  4. トレーナー – RLCD 目的関数を使用してモデル重みを更新。
  5. BYO モデルデプロイ – 微調整されたモデルを Workers AI 上に再デプロイ。

このサービスは初期段階では ハンドオンパートナー オファーとして、Forward-Deployed Engineer (FDE) チームと連携して提供され、後続にはセルフサービスプラットフォームの計画がある。

Hacker News でのコミュニティの反応

コメントのテーマ 代表的な引用
パフォーマンス vs コスト "価格は 100 万トークンあたり $0.24 で、Jev より約 6 倍高い。Clef‑flash は $0.09/M で、より競争力がある。" – ssiddharth
オープンソースへの懸念 "重みはオープンだが、オープンソースではない。データとトレーニングパイプラインは公開されていない。" – buildbuildbuild
ビジョン機能 "画像入力が可能。素晴らしい!" – swingboy
速度と精度のトレードオフ "Clef‑flash は速いが、時々過剰にエスカレートする。Clef はより正確だが遅い。" – agrippanux
実用性 "Clef が 2 秒でドメイン分類を決定できるなら、未分類のサイトについてサポートチケットを提出する必要はない。" – johnbatch
新規性への懐疑 "Jev のリリースから数日で多くのチームが決定モデルを構築できた。このコンセプトはすでに成熟しているのだろうか?" – warkdarrior
校正への疑念 "校正について言及がない。単なる LLM の微調整にすぎないのだろうか?" – zwaps

全体的な評価は、オープンソースリリースと高速性の向上に対して肯定的だが、レビューでは価格の高さ、再現可能なトレーニングパイプラインの欠如、本番レベルの精度に到達するための微調整の必要性が指摘されている。

Clef とフル LLM の使い分け

  • Clef を使うべき場合:
    • 構造化された、確率に基づく意思決定が必要。
    • エッジでの低レイテンシ(200 ms 未満)。
    • ビジョン対応の分類。
    • 後続の自動化に向けた決定論的な見た目の出力。
  • 生成型 LLM を使うべき場合:
    • 自由なテキスト生成、推論、ツールコールのオーケストレーションが必要。
    • 複雑なマルチターン対話が必要。
    • 数百ミリ秒のオーバーヘッドが許容できる状況。

はじめ方

  1. ホストされたエンドポイントを試す – 上記の API 例に従う。
  2. 重みをダウンロードする – git clone https://huggingface.co/Cloudflare/clef。
  3. ローカルで実行する – 標準の transformers または vLLM パイプラインを使用(モデルは Jev 互換スキーマを期待する)。
  4. ライブベンチマークデモを探索する – https://clef-evals.workers-ai-mle.workers.dev/。
  5. 微調整について Cloudflare に連絡する – ブログ記事にリンクされた興味フォームを埋める。

今後の展望

Clef は、決定に特化したモデルが 高品質 かつ エッジ対応 であることを示しており、重量級 LLM と従来の分類器の間のニッチを形成している。今後リリース予定のセルフサービス型 RL 微調整プラットフォームにより、企業が独自のドメインにモデルをカスタマイズできるようになり、Cloudflare のインフラを離れずに済む。

エージェントワークフローを構築しており、視覚入力がある場合を含め、迅速かつ構造化された意思決定が必要な場合、Clef と Clef‑flash は Jev や汎用 LLM に対する魅力的なオープンソース代替手段となる。

Sources

関連