Jeeves: 推論と拡散ドラフトを用いた意思決定モデルの改善

概要

Jeevesは、『Jev風』の意思決定モデルの精度を向上させる推論機能を備えた分類器です。最終判断の前に推論チェーンを統合することで、確率が校正されているものの精度が低いという、従来の意思決定モデルにおける一般的なトレードオフを解決します。

Qwen3.5-9BにLoRAとポインタヘッドを組み合わせ、Supervised Fine-Tuning (SFT) と CISPO を用いて、モデルが判断する前に『考える』能力を実現させ、オフドメインタスクおよびJevBenchの難易度の高いベンチマークにおいて優れた性能を発揮します。

パフォーマンスベンチマーク

Jeevesは、JevやKev-9Bといった従来の意思決定モデルと比較して、特に複雑または未見のシナリオにおいて顕著な精度向上を示しています。

精度比較

ベンチマーク Kev-9B Jev Jeeves
テスト全体 (オフドメイン/ホールドアウト) 0.822 0.857 0.889
JevBench全体 (231件の公開項目) 0.715* 0.866 0.935
JevBenchハード (111件の公開項目) 0.451* 0.730 0.865
PAWS 0.763 0.788 0.875
ホールドアウトされたルール構造 0.896 0.885 1.000
対照的ポリシー 0.900 0.963 1.000

注: JevBenchにおけるKev-9Bの結果は、Kev-8B (Qwen3) のデータに基づいています。

トレードオフと制限事項

Jeevesは精度において優れていますが、推論プロセスにより遅延が発生します。

  • 知識ギャップ: MMLU (0.793 vs 0.900) や MMLU-Pro (0.739 vs 0.840) といった純粋な知識ベンチマークでは、Jevに比べてJeevesは劣ります。
  • 遅延: 完全な推論チェーンではp90遅延が17秒に達します。推論なしではモデルは約0.3秒で応答します。
  • 解釈可能性: 学習中に言語の一貫性報酬が使用されていないため、推論チェーンは高い解釈可能性を備えていません。

技術的アーキテクチャ

意思決定メカニズム

Jeevesは、状態、指示、選択肢を分離する特定のプロンプトフォーマットを使用します。モデルは<reason>タグ内に推論チェーンを生成します。推論ブロックの後、モデルは再び指示と選択肢にプロンプトされ、その後<decide>トークンが出現します。

その後、ポインタヘッドは<decide>トークンの隠れ状態のクエリ投影と、対応する選択肢の</opt>トークンの隠れ状態のキー投影のスケーリングドット積を計算し、最終的な確率はこれらのスコアをsoftmax関数で処理し、開発セットで適合された温度パラメータで調整されます。

学習パイプライン

  1. SFT: Qwen3.5-9Bとポインタヘッドに対してLoRA (r=16) を用いて2エポックのSupervised Fine-Tuningを実施。公開データセットおよび合成ポリシーデータから得た19,126問を使用。
  2. CISPO: 9,992問のRL質問を用いた強化学習スケジュール。各質問に対して8回のロールアウトを行い、最大2,560トークンの推論トークン数を上限とする。
  3. 校正: 開発セット上で最終的な温度調整を行い、確率の校正を保証。

拡散ドラフト

グリーディデコードの遅延を軽減するために、JeevesはOrthrusにインスパイアされた拡散ドラフトを実装しています。このドラフトはQwen3.5のGated DeltaNetレイヤーをサポートしており、マスクトークンが畳み込み後のキーと値に跨ってアテンションできるようにしています。

速度改善:

  • プレーンなグリーディデコード (1問): 109トークン/秒
  • ブロック4ドラフト (1問): 176トークン/秒 (1.6倍の向上)
  • ブロック8ドラフト (1問): 193トークン/秒 (1.76倍の向上)

実装と使用方法

JeevesはJev APIと互換性があり、1回のリクエストで3種類の質問をサポートします:

  • noul: Yes/No質問。校正された確率を返す。
  • choice: 複数選択質問。
  • score: 提供された凡例に基づく評価質問。

遅延最適化

ユーザーは以下のオプションを使って、速度と精度のバランスを調整できます:

  • think: 推論のオン/オフを切り替え。
  • max_think: 推論トークン数の上限を制限(例:768トークンに制限すると、中央値遅延は3.3秒から2.0秒に低下)。
  • nothink_threshold: 初期の「推論なし」の信頼度がこの値を超える場合、推論をスキップ。

コミュニティの知見

開発者間の議論では、推論モデルの高精度と意思決定モデルの高速性という要求との間で緊張が生じています。

"17秒もかかってどうするの?それならLLMを使えばいい。Jevの魅力は、安価で極めて高速な点にある。"

他の貢献者らは、単純なタスクにはJev風モデル、複雑なタスクにはJeevesのような推論機能を持つモデルを組み合わせるハイブリッドアプローチが、実用的な生産パスである可能性を示唆しています。一部のユーザーは、コンシューマーハードウェア(例:M5 Pro)では、特定の皮肉検出ベンチマークで100件のツイートに対して推論プロセスが30分以上かかることを報告しています。

Sources

関連