Kev: Qwen3.5 を基盤としたオープンソースの意思決定モデル

Kev は、高速で構造化された分類および評価に適した小さな意思決定モデルのファミリーです。Qwen3.5 のベースモデル上で構築されており、Jev にインスパイアされたアーキテクチャを採用することで、1回のフォワードパスで1つの入力テキストに対して複数の意思決定質問(はい/いいえ、複数選択、評価)を処理できます。

アーキテクチャと実装

Kev は Qwen ベースモデル上にランク16の LoRA アダプタとカスタムポインタヘッドを使用しています。システムは入力状態を一度処理し、その計算を複数の独立した質問に再利用することで、効率を最大化するように設計されています。

質問の分離と処理

Attentionのみのベースモデル(例:Qwen3)の場合、Kev は特定のアテンションマスクを使用して、トークンが入力状態と自身の質問のみを読み取れるようにし、他の質問を読むことを防ぎます。これにより、質問が独立して相互に影響しないことを保証します。

Qwen3.5 モデルは、アテンションマスクを無視するゲート付き DeltaNet レイヤー(再帰層)を含むため、Kev は各質問を独立した行として処理します。サーバーは状態を一度計算し、すべての行でキャッシュを再利用することで、質問間の完全な分離を維持します。

ポインタヘッド

テキストトークンを生成するのではなく、Kev はポインタヘッドを使用して、各選択肢の終了タグ(</opt>)の隠れ状態を、質問の意思決定トークン(<decide>)の隠れ状態と比較してスコア付けします。その後、ソフトマックス関数によりこれらのスコアを確率に変換し、各回答に対する校正された信頼度を提供します。

モデルファミリーとパフォーマンス

Kev は 0.8B、4B、9B の3つのサイズで利用可能です。すべてのモデルは同じデータと設定で訓練されており、メモリと精度の要件に応じてモデルを選択できます。

ベンチマークと精度

Kev-9B が最も高性能なモデルで、テストセットで 0.852 の精度を達成しています。新規ソースの開発セットではホストされた Jev モデルより 3.5 ポイント低い(0.822 対 0.857)ものの、未観測のポリシー規則タイプへの汎化能力が優れています。

モデル ベース 精度(新規ソース - テスト) Brier スコア(新規ソース - テスト)
Kev-0.8B Qwen3.5-0.8B 0.684 0.460
Kev-4B Qwen3.5-4B 0.837 0.255
Kev-9B Qwen3.5-9B 0.852 0.237

サービングパフォーマンス

遅延はハードウェアによって大きく異なります。CUDA(H100)では、5つの質問に対するリクエストは数十ミリ秒です。Apple Siliconでは DeltaNet レイヤー用の高速カーネルが不足しているため、9Bモデルは1リクエストあたり約2秒かかりますが、4Bモデルは約779msです。Macで低遅延が必要な場合は、前世代の Qwen3 ベースモデルが推奨されます。

API と統合

Kev の API は TypeSafe の System One と互換性があり、TypeSafe Python SDK とのシームレスな統合が可能です。/v1/systemone エンドポイントは state(評価対象のテキスト)と questions のセットを受け取ります。

対応する質問タイプ

  • noul: 二値の「はい/いいえ」質問で、「はい」の確率を返します。
  • choice: 複数選択質問で、最も可能性の高い選択肢、すべての選択肢の確率、および信頼度スコアを返します。
  • score: 評価質問で、平均レベルインデックス、凡例、および確率を返します。

訓練とファインチューニング

Kev は正しい答えに対する交差エントロピーで訓練されており、ベース重みは固定されたまま、アダプタとポインタヘッドを同時に訓練します。

カスタムファインチューニング

ユーザーは JSONL 形式の独自ドメインデータで Kev をファインチューニングできます。作者は --init_from フラグを使用してリリースされたチェックポイントのアダプタとポインタヘッドをロードすることを推奨します。これにより、モデルの汎用的な意思決定能力を維持しつつ、ドメイン固有の知識を追加できます。あるテストでは、ベースモデルからファインチューニングすると Kev の評価セットで 0.33 のスコアでしたが、リリースされたチェックポイントからファインチューニングした場合は 0.83 の精度を維持し、新ドメインでは 0.88 に達しました。

制限と考慮事項

  • 校正: 新規ソースでは生の確率が過信しやすいです。KEV_TEMPERATURE=2.0 を使用すると、Kev-9B の確信誤り(確率 ≥ 0.9 の誤答)が 8.7% から 4.4% に低下します。
  • 日付演算: モデルは生の日付減算に苦戦します。KEV_DATE_FACTS=1 を設定すると、絶対日付間の日数が付加され、Kev-9B の締切ポリシー質問の精度が 0.80 から 0.90 に向上します。
  • 選択肢の順序: 1つの質問内で選択肢の順序を変更しても、依然として回答に影響を与えることがあります。質問の分離にもかかわらずです。
  • 知識ギャップ: Jev と比較して、一般知識(MMLU)に大きなギャップがあります。これはベースモデルの制限に起因するとされています。

コミュニティの知見

開発者間の議論では、Jev に似たモデルは内部ルーティングロジック、データラベリング、エージェントワークフローにおけるツールコールのオーバーヘッド削減に特に有用であるとされています。あるユーザーは、プロキシを使ってプロンプトを Jev にルーティングし、前もってツールを絞り込んだ後、フロンティアモデルに送信することで、ツールコールを60%削減していると述べています。

しかし、一部の批判者は、Jev の本質的な価値はそのアーキテクチャではなく、トレーニングデータにあると主張しており、類似の高品質データセットがなければ、オープンソースの派生モデルは元のホストモデルのパフォーマンスを追従できない可能性があると指摘しています。

Sources

関連

  • プロジェクト
  • プロジェクト
  • Dispatch
  • プロジェクト
  • Dispatch