AIコンピュートの未来、推論特化、継続学習に関するJeff Dean

基本的な主張:コンピュートのスケーリングと自律エンジニアリングへの道

次の10年間でコンピュート能力が100万倍に増大すれば、AIは受動的なトークン予測から自律的な問題解決へとシフトする可能性が高い。Jeff Deanによれば、この規模のコンピュートにマルチエージェントワークフローやシミュレーション環境が組み合わさることで、AIは航空機や新しいコンピュータチップの設計といった複雑なエンジニアリングタスクを、数年ではなく数日で実現できるようになるだろう。

訓練データのボトルネックを克服する

業界が高品質なテキストデータを使い果たしているという考えに反して、Jeff Deanは、いくつかのアプローチにより大幅な成長が依然として可能であると主張している。

  • 未活用のモダリティ: まだ十分に活用されていない膨大な量の動画データが存在する。
  • 合成データとRL: 強化学習(RL)のロールアウトにより高品質な合成データを生成できる。コーディング問題に対して数千の潜在的解を探索し、コンパイルできユニットテストに合格するものだけをフィルタリングすることで、モデルは独自の高品質な訓練セットを作成できる。
  • クロス言語拡張: ある言語(例:Python)で検証されたコードを完全に指定されたプロンプトとして使用し、別の言語(例:Go)で同等の高性能コードを生成できる。これにより、訓練セットに検証済みの振る舞いデータを効果的に追加できる。
  • アルゴリズム効率: 新しい手法により、モデルは既存データから複数回のパスを通じてより多くの情報を抽出できるようになる。

推論特化ハードウェアへのシフト

データセンターにおける機械学習ワークロードは、推論へと大きくシフトしている。この転換には、汎用の訓練ハードウェアから推論特化シリコンへの移行が必要となる。

なぜ特化が重要か

推論ワークロードは訓練といくつかの重要な点で異なる:

  • 精度要件: 推論ははるかに低い精度でも機能できる。Deanは、FP4(4ビット浮動小数点)が驚くほど効果的であり、スケーリングファクタと組み合わせた2ビットまたは1ビット整数へのさらなる削減も可能かもしれないと指摘している。
  • 重みの安定性: 訓練とは異なり、推論中はモデルの重みが変化しないため、柔軟性よりもエネルギー効率とスループットを優先したハードウェア最適化が可能になる。
  • ボリューム: エージェントベースの行動やオフラインRLロールアウトの増加により、推論リクエストの総量が増大し、ワット当たりの性能向上と低レイテンシが求められる。

Googleはすでに、これらの異なる計算特性に対応するよう特別に設計されたTPU 8iおよび8tチップでこの転換を開始している。

事前学習と事後学習の統合

Jeff Deanは、現在の事前学習と事後学習の厳格な分離を「知的に満足できない」と見なしている。彼は学習のインタリーブ方式を提唱している:

  • アクティブラーニング: トークンを受動的に観測するだけでなく、モデルはシミュレートされた環境や実環境で行動を取り、結果を観測し、そこから学習すべきである。
  • 継続的学習サイクル: 理想的な状態は、データを観測し、その知識を行動に適用するサイクルである。安全プロトコルやレッドチーミングはモデルをユーザーに提供する前に必ず実施されるべきだが、基盤となるモデルは裏で学習を続けるべきである。

「ライフタイムAI」のためのアテンション問題の解決

「ライフタイムAI」――ユーザーの全デジタル履歴や企業の全コードベースにアクセスできるシステム――を実現するためには、業界は標準的なアテンション機構の二次的コスト($O(n^2)$)を超える必要がある。

無限コンテキストのための戦略

完全なアテンション機構は数十億トークンに対してはコストが高すぎるため、Deanは階層的リトリーバルアーキテクチャを提案している:

  1. 広範リトリーバル: システムは数十億の中から数千件の関連文書を特定する。
  2. 精緻なフィルタリング: 軽量モデルがそれらをさらに絞り込み、数十件程度の高度に関連したスニペット(例:117件)にする。
  3. 高精度処理: これらのスニペットを、より大きく高性能なモデルの高価なコンテキストウィンドウに投入する。

このオーケストレーションにより、計算的に実現可能なまま、巨大なコンテキストウィンドウの錯覚が生まれる。

蒸留とオープンソースエコシステム

知識蒸留は、最先端レベルの能力をより小型で高速なモデルに提供する主要な手段である。Deanは、FlashシリーズやGemmaといった小型モデルが最先端モデルにほぼ匹敵する「魔法のソース」は、より大きく高性能なモデルが小型モデルに教えるプロセスにあると説明している。

これにより共生関係が生まれる:業界は、知識を効率的な「作業馬」モデル(本番環境で使用される)に蒸留できるよう、意図的に大規模で非効率的な最先端モデルの構築を続けなければならない。

大規模エンジニアリング:宇宙線とハードウェア障害

Google規模のデータセンターを運用すると、ハードウェアが本質的に信頼できないことが明らかになる。Deanは大規模システムのいくつかの重要な実情を指摘している:

  • 宇宙線: 遠方の超新星からのアルファ粒子がDRAMで単一ビットのフリップを引き起こすことがある。GoogleはECC(エラ―訂正コード)メモリを通じてこれらのエラーを監視しており、地球上の特定の方向を向くクラスターが特定の宇宙イベント時にエラー率が高くなることを観測している。
  • ソフトウェアによる信頼性: ハードウェアが故障するため、Googleは信頼性の低い部品から信頼できるシステムを構築することに注力している。初期には、ECCメモリを持たない消費者向けハードウェア上のデータ破損に対処するため、ソフトウェアベースのチェックサムシステムを構築していた。

Sources