Google DeepMind Decoupled DiLoCo
Google DeepMind Decoupled DiLoCo
Google DeepMind は、地理的に離れたデータセンター間で大規模言語モデル (LLM) をトレーニングするために設計された新しい分散アーキテクチャである Decoupled DiLoCo (Distributed Low-Communication) の発表を行いました。トレーニング実行を非同期の「アイランド」コンピューティングに分離することで、システムはハードウェア障害を隔離し、従来の厳密に結合された同期に関する通信ボトルネックを排除します。
非同期トレーニングとハードウェアのレジリエンス
Decoupled DiLoCo は、学習ユニットと呼ばれる別々のコンピューティング アイランド間で非同期データフローを使用したトレーニングを可能にします。このアーキテクチャにより、ある地域のチップ障害が他の学習ユニットの進行を中断することを防ぎ、従来の方法よりもはるかに故障に強いシステムとなります。
主要なレジリエンス機能:
- 自己修復インフラストラクチャ: システムは学習ユニット全体の損失後もトレーニングを継続し、オンラインに戻ったときにシームレスに再統合できます。
- カオスエンジニアリング検証: Google DeepMind は人工的なハードウェア障害を使用して、従来のトレーニング方法と比較して障害時の学習クラスターの可用性が高まることを確認しました。
- ML パフォーマンスのパリティ: Gemma 4 モデルでのテストにより、Decoupled DiLoCo はハードウェア障害へのレジリエンスが向上しているにもかかわらず、従来のトレーニングアプローチと同じベンチマーク済みの機械学習パフォーマンスを提供することが示されました。
低帯域幅、グローバル規模のプリトレーニング
Decoupled DiLoCo は、ワイドエリアネットワーク (WAN) を跨いだ本番レベルのプリトレーニングのために設計されており、コンピューティング ユニットが同期を待つ「ブロッキング」ボトルネックを回避します。
実際の実験では、Google DeepMind は 4 つの別々の米国地域で 120 億パラメータ モデルをトレーニングしました。技術的な結果には以下が含まれます:
- ネットワーク要件: トレーニングは 2-5 Gbps のワイドエリアネットワークで実行され、データセンター間の既存のインターネット接続で達成可能な帯域幅レベルです。
- 速度の向上: システムは、計算の長い期間に通信を組み込むことにより、従来の同期方法よりも 20 倍以上高速なトレーニング結果を達成しました。
- 帯域幅の効率: このアーキテクチャは、従来のトレーニング方法と比較して桁違いに少ない帯域幅で済みます。
異種ハードウェアのサポート
このアーキテクチャは、単一のトレーニング実行内で異なる世代のハードウェアを混在させることを許可し、利用可能なコンピューティングの総量を増やし、ハードウェアのライフサイクルを延ばします。
Google DeepMind は、異なる速度で動作する TPU v6e と TPU v5p のチップを混在させても、単一チップタイプのトレーニング実行と同じ ML パフォーマンスが得られることを実証しました。この機能により、異なる施設での新しいハードウェア世代の段階的なロールアウトによって引き起こされるロジスティクス上のボトルネックが緩和されます。