スタンフォード CS329A 自己改善型 AI エージェント 今後の研究分野 講義サマリー
この講義では、自己改善型 AI エージェントを進歩させるための4つの主要な研究フロンティアが特定されています:推論チェーンの多様性の向上、検証ループの強化、モデルが自身の訓練タスクを提案できるようにすること、およびワットあたりの知能として測定される推論効率の向上です。
推論チェーンの多様性(マルチエージェント ファインチューニング)
単一の言語モデルを使用して合成データを生成すると、低分散の推論チェーンが生じ、数回のファインチューニング反復後に性能が頭打ちになります。マルチエージェント ファインチューニングは、多様な初期解を生成するいくつかの専門的な生成エージェントと、それらの解を評価および改良する批判エージェントを使用することでこの問題に対処します。反復を通じて、生成エージェントは次の応答を生成する前にピアの出力を要約し、批判エージェントは正解と不正解の答えを対比する方法を学びます。このプロセスにより、多数決のような多様性が無償で得られ、数学のベンチマーク(例えば、Llama は反応性を示す)での性能向上を継続し、単一エージェント ファインチューニングでは崩壊する精度とは対照的に、GSM‑8k などの隣接データセットへの一般化も可能になります。
検証とメタ検証(DeepSeekMath-V2)
結果報酬モデルにのみ依存すると、特に定理の証明において正解の最終答案が間違った手順を隠すことがあるため、誤った推論チェーンを見逃すことがあります。DeepSeekMath‑V2 は、参照解なしで証明の問題を検出する方法を学ぶ検証器と、検証器が特定した問題が実際に問題であるかどうかを判断するメタ検証器を導入します。人間は問題のある証明にラベルを付けます;検証器は0.5‑1 のスケールで証明をスコアリングするように訓練されます;メタ検証器は検証器の分析を評価します。このループを反復することで証明スコアが向上します:8回の反復後スコアが上昇し、32個の生成された証明のうち最良のものを選択すると、IMO shortlist 2024 で約42% に達します。ジェネレータはより高品質な証明を好むように学習し、検証のボトルネックを突破します。
自己生成タスクカリキュラム(Absolute Zero)
モデルが人間の専門知識を超えるにつれ、プロンプトと検証タスクのキュレーションがボトルネックになります。Absolute Zero は、単一のモデルが自身のタスクを両方提案し解決できるようにします。提案者は過去の例に条件付けられて多様性を促進し、誘導、演納、帰納のコーディングタスクを作成し、タスクの難易度(1 − 成功率)に基づいて報酬を受け取ります。これにより、ソルバーが時々成功し時々失う中程度の難易度のタスクが狙われます。提案されたタスクは実行、安全チェック、決定的出力チェックによって検証され、シードトリプレットのバッファがカリキュラム学習をサポートします。結果は、人間がキュレートしたプロンプトデータを一切使用せずに最先端のコーディング性能を示し、数万の専門家例で訓練されたモデルを上回ります。時間とともに複雑さと多様性が増加し、数学のベンチマークへの転移効果も得られます;より大きなモデルほど恩恵が大きいです。
ワットあたりの知能の効率向上
ワットあたりの知能は、≤20B アクティブパラメータのローカルモデルを使用して、タスクの平均正確度を平均消費電力で割った値として定義されます。2023 年以降、そのようなモデルで解決可能なチャットボットクエリの割合は 3.1 倍に改善し、実際のクエリの 88.7% に達しました。ハードウェアの効率がさらに 1.7 倍寄与し、2 年間で合計 5.3 倍のワットあたりの知能の向上をもたらしました。ローカルアクセラレータ(例えば、Apple M4 Max)はエンタープライズチップの B200(約1.5 倍低いワットあたりの知能)に劣りますが、この傾向はエッジデバイスへの推論のシェアが増加していることを示唆しています。
オープンな研究課題
- 持続的学習:問題解決から得られる肯定的および否定的な経験を、オフラインファインチューニングに頼るのではなく、オンラインでモデルの重みまたはメモリに統合する方法は?長期記憶システム、巨大なコンテキストウィンドウ、またはナレッジベースキャッシュを介して実現できる可能性があります。
- テストタイムスケーリングインフラストラクチャ:推論中の繰り返しサンプリング、ツール呼び出し、検索に最適化されたシステムが必要です。高スループット・低レイテンシーワークロードを処理するために、hydrogen トークン SRS のような仕組みを基盤とする必要があります。
- ハイブリッドローカルクラウド推論:クエリの複雑さに基づいてローカルおよびクラウドモデル間のトラフィックを動的に割り当てるルーティングメカニズムを開発し、ローカルアクセラレータ向けのエネルギー効率の良いカーネルも併せて必要です。
- 検証不可能なドメイン:チップ設計や科学シミュレーションのようにグランドトゥルースの検証が遅いまたはコストが高い分野では、オフラインデータからシミュレーション結果を予測する報酬モデルを訓練します。このとき、モデルの汎用性はデータカバレッジに依存し、不正確さのリスクがあることを認識してください。
これらの方向性は、講義における自己改善型 AI エージェントの現在の制限と新たな機会の分析から直接導き出されています。