OpenAI MRC マルチパス信頼接続プロトコル

OpenAIは、最先端AIモデルのトレーニングに使用されるスーパーコンピュータクラスターにおいて、混雑を排除しハードウェア障害の影響を最小化することを目的とした新しいネットワーキングプロトコル「Multipath Reliable Connection(MRC)」を導入しました。AMD、Broadcom、Intel、Microsoft、NVIDIAとの協業で開発されたMRCは、現在Open Compute Project(OCP)仕様として提供され、高性能AIネットワーキングの標準化を目指しています。

同期AIトレーニングにおけるネットワークボトルネックの解決

同期事前学習では、数千台のGPUがロックステップで動作する必要があり、ネットワーク混雑やハードウェア障害によるデータ転送の遅延が1つだけでもトレーニングジョブ全体を停止させてしまいます。クラスターがOpenAIのStargateインフラ規模に拡大するにつれて、これらの「障害増幅器」はますます頻繁かつ破壊的になります。

この規模の従来型ネットワーキングでは、主に2つの課題があります。

  • 混雑: 複数のGPUが同時に同一宛先へデータを送信する際に避けられないボトルネックが発生しますが、一般的なネットワーク混雑は非効率なルーティングに起因することが多いです。
  • 障害の影響: 従来のネットワークでは、1本のリンクやスイッチの障害がトレーニングジョブをクラッシュさせ、チェックポイントからの再起動が必要になるか、ネットワークがルートを再計算する間に数秒の停止が発生します。

MRC アーキテクチャ:マルチプレーンネットワークとパケットスプレーイング

MRCはRDMA over Converged Ethernet(RoCE)を拡張し、Ultra Ethernet Consortium(UEC)やSRv6ベースのソースルーティングの技術を取り入れることで、より予測可能なネットワークファブリックを実現します。

マルチプレーントポロジー

ネットワークインターフェースごとに単一の800Gb/sリンクを使用する代わりに、MRCはインターフェースを複数の小さなリンク(例:8本の100Gb/sリンク)に分割し、別々の平行ネットワーク、すなわち「プレーン」へ接続します。

このアーキテクチャの変更により、OpenAIは従来の800Gb/sネットワークが必要とする3〜4層のスイッチに対し、2層のスイッチだけで10万台以上のGPUを接続できるようになりました。層数の削減は電力消費を抑え、故障しやすい部品の数を減らし、ネットワーク全体のコストを低減します。

アダプティブパケットスプレーイング

マルチプレーンネットワークの冗長性を活用するため、MRCは単一パスのフローをパケットスプレーイングに置き換えます。転送を1つの経路に割り当てるのではなく、単一の転送からのパケットをすべての異なるプレーンにまたがる数百の経路に散布します。

  • 順序外配信: パケットには最終的なメモリアドレスが含まれており、順序に関係なく到着次第メモリへ書き込むことができます。
  • 負荷分散: MRCは経路の混雑を監視し、混雑した経路を利用可能な経路に動的に切り替えてネットワーク負荷を均等化します。
  • 障害復旧: パケットが失われた場合、MRCは直ちにその経路の使用を停止し、データを再送します。その後、プローブパケットで経路が回復したかを確認します。
  • パケットトリミング: 経路障害と宛先側の混雑を区別するため、スイッチはパケットを「トリム」でき、ペイロードを除去してヘッダーだけを転送し、経路を失敗とみなさずに明示的な再送要求をトリガーします。

SRv6 ソースルーティングで制御プレーンを簡素化

MRCは、微妙に失敗した際に診断が困難になることがあるBGP(Border Gateway Protocol)などの動的ルーティングプロトコルの複雑さを排除します。

IPv6 Segment Routing(SRv6)を使用することで、送信側は各パケットが通るべき完全な経路をスイッチ識別子のシーケンスとして宛先アドレスに直接エンコードします。スイッチは設定時に構成された静的ルーティングテーブルに従うだけで、変更はありません。経路が失敗した場合、送信側が独自にロスを検知しその経路の使用を停止するため、スイッチがルートを再計算する必要がなくなります。

本番性能とレジリエンス

MRCは現在、OpenAIの最大規模のNVIDIA GB200スーパーコンピュータに展開されており、テキサス州アビリーンのOracle Cloud Infrastructure(OCI)拠点やMicrosoftのFairwaterスーパーコンピュータなどでも利用されています。

OpenAIは以下の本番での成果を報告しています。

  • リンクフラップの影響ゼロ: tier-0 と tier-1 スイッチ間で1分間に複数回のリンクフラップが発生しても、同期事前学習ジョブへの測定可能な影響はありません。
  • シームレスなハードウェア保守: tier-1 スイッチはサービス中に再起動やリンク修復が可能で、トレーニングチームとの調整は不要です。MRCが自動的に影響を受けたハードウェアを迂回します。
  • 段階的な劣化: GPUインターフェースの8ポートのうち1つが失われても、トレーニングジョブは継続します。MRCは失敗したプレーンを回避するように経路を再計算し、ピアにそのプレーンへの受信トラフィック使用停止を通知します。その結果、性能低下は物理的な容量損失よりはるかに小さく抑えられます。

主要技術的優位性の概要

機能 AIトレーニングへの影響
マルチプレーン設計 2層のスイッチだけで10万台以上のGPUを接続し、電力とコストを削減します。
パケットスプレーイング コアの混雑を排除し、フロー間のスループット変動を減少させます。
SRv6 ソースルーティング 複雑な動的ルーティングを静的制御プレーンに置き換え、マイクロ秒単位で障害を回避します。

要約: OpenAIは、Open Compute Projectを通じてMultipath Reliable Connection(MRC)プロトコルを公開し、大規模AIトレーニングクラスターにおけるGPUネットワーキングのレジリエンスと性能を向上させました。

タイトル: OpenAI MRC マルチパス信頼接続プロトコル

Sources