高速エージェント意思決定のための対照的言語モデル(CLM)
対照的言語モデル(CLM)は、行動選択を生成的な問題ではなく、検索的な問題として扱うことで、高速なエージェント意思決定を可能にします。状態と行動の埋め込みを共有空間に整合させる対照学習目的を活用することで、CLM-8Bは、コンピュータ利用、ゲーム、ツール呼び出しのタスクにおいてJevと同等の性能を達成しつつ、遅延を最大9倍まで削減しています。
アーキテクチャ:状態と行動エンコーダーの分離
CLMは標準的な自己回帰(AR)生成プロセスを、二重エンコーダー構造に置き換えます。システムは、状態エンコーダーと行動エンコーダーから構成され、両方とも固定されたLLMバックボーンにその後にトレーナブルなMLPプロジェクションヘッド(約20Mパラメータ)を接続しています。
- メカニズム:両エンコーダーはそれぞれの入力を共有埋め込み空間にマッピングします。状態-行動ペアのスコアは、それらの埋め込み間のコサイン類似度として計算されます。
- 推論効率:状態と行動が分離されているため、それぞれの埋め込みは独立してキャッシュできます。行動セットが固定されている環境(例:Super Mario)では、モデルは各ステップで状態埋め込みのみを再計算し、キャッシュされた行動埋め込みを再利用します。これにより、複数のフォワードパスから1ステップあたり1回のパスに計算コストを削減できます。
- スケーリング:約1,000の候補行動に対して、CLMはJevよりも13倍速いと報告されています。
学習パイプラインとスケーリング則
CLMは、状態-行動の整合性を段階的に向上させるために3段階の学習ステージで訓練されます。
- 事前学習:モデルは約60MのNemotron Q&Aペアを用いて、双方向InfoNCE損失で訓練され、質問を状態、回答を行動として扱います。これにより広範な意味表現が確立されます。
- 中間学習:モデルはGemini 2.5 Flash-Liteによって生成された約30Mの合成ハードネガティブ例にさらされます。これらは意味的に類似しているが誤りである回答であり、微細な識別力を向上させるために設計されています。
- 後学習:モデルはAgent Data Protocol(ADP)データセットから約1MのエージェントトラジェクトリとEndless-TerminalsおよびLiteCoder-Terminal-SFTからの終端トレースを用いて訓練され、エージェント環境向けの表現空間に適応します。
後学習中に深刻な記憶喪失を防ぐために、チームはデータリプレイを用いたコトレーニングを採用しており、40%のNemotron DQA例と60%のエージェントトラジェクトリを混合しています。
スケーリング則:テスト対照損失は、訓練計算量、データセットサイズ、プロジェクションヘッドサイズ、エンコーダーサイズに対してべき乗則に従います。エンコーダーサイズの拡大が最も強力な性能向上をもたらします。最適なプロジェクションヘッドサイズ($N^*$)は訓練トークン数($D^{1.02}$)に線形に増加し、平均してパラメータ1つあたり約310トークンです。
性能とベンチマーク
CLM-8Bは、他のモデル(例:Opus 5やFable 5)が複数の候補をサンプリングした結果から最良の解を選び出すための報酬モデルとして使用する際、特に優れた検証能力を示しています。
- エージェント型コーディング:CLMはDeepSWE(81.6%)およびTerminal Bench 2.1(87.6%)で最先端(SOTA)の結果を達成しています。
- 遅延:H100 GPU上で、CLMは検証タスクにおいてJevよりも4〜6倍速い推論を実現しています。
- 汎化能力:事前学習により、モデルの表現が有用な意思決定空間に再構成され、ゴールド回答をベースラインLLM埋め込み(例:Qwen3-8B)よりも正しく上位にランク付けできるようになっています。
コミュニティの知見と技術的批判
技術ユーザー間の議論から、CLMアプローチに関するいくつかの重要な視点が浮き彫りになっています。
- 検証 vs 生成:一部のユーザーは、DeepSWEでの高スコアが、解を完全に生成するのではなく、複数の候補の中から最良のものを選ぶ検証者として機能していることに注目しています。
- 帰納的バイアス:批判者たちは、独立してエンコードされたベクトル間のコサイン類似度が、WikiRacingのような大規模Kの意味的行動マッチングには有効である一方で、日付演算や否定チェーンのような「型付き意思決定」タスクでは苦戦する可能性があると指摘しています。
- 用語の問題:「System One」という用語の使用に対して反発があり、ユーザーたちはカーニーマンの枠組みが人間の認知プロセスを説明するものであり、AIモデルの速度に基づく分類には適さないと主張しています。
- ハードウェア効率:RTX 40901台で約1時間でプロジェクションヘッドを訓練できる能力は、一般消費者向けハードウェアで作業する開発者にとって特に魅力的です。
"このアプローチは本当に素晴らしいと思います。現代のLLMを使って入力を処理し、その後モデルの次のエージェント的ステップを非常に高速かつ非AR的に抽出できる可能性があることを示唆しています。その結果は、通常のARデコードと比較して同等の品質です。"
今後のロードマップ
プロジェクトは、現在訓練中のマルチモーダルCLM-35Bへと拡張しています。今後の目標には、ロボット工学やコンピュータ利用タスク向けに画像と動画をサポートするアーキテクチャの拡張、およびハードネガティブマイニングとエージェント後学習のためのデータレシピのさらなる拡張が含まれます。
Sources
関連
- Dispatch
- プロジェクト
- プロジェクト
- プロジェクト
- Dispatch