OpenAI、Claude、およびGrokの同時障害

複数プロバイダーのAI障害の概要

OpenAI、Claude(Anthropic)、Grok(xAI)を含むいくつかの主要なAIプラットフォームで、同時にサービス障害が発生しました。当初の憶測では広範なDNSまたはCloudflareの問題が指摘されていましたが、証拠によると根本的な原因は物理的なコンピュートインフラに集中していました。

根本原因:xAIのメンフィスコンピュートセンターの障害

今回の障害の主な原因は、メンフィスにあるxAIのコンピュートセンターの停止でした。xAIはこのインシデントを公式に認め、次のように述べています。

今朝、当社のメンフィスコンピュートセンターで障害が発生したことに伴い、Grokで問題が発生した可能性があることをお詫び申し上げます。また、影響を受けたコンピュートパートナーの皆様にもお詫び申し上げます。

この声明は、メンフィスの施設がGrokだけでなく、他の「コンピュートパートナー」にもコンピュートリソースを提供していたことを裏付けており、複数の独立したAIプロバイダーが同時に障害を経験した理由を説明しています。

理論的なカスケード障害と「サンダリングハード」

物理的なインフラの障害に加えて、ユーザーがプラットフォーム間を移動したことで、二次的な「カスケード」効果が発生したとコミュニティの分析で示唆されています。「サンダリングハード」問題として知られるこの現象は、多数のユーザーが同時にフォールバック先のプロバイダーにワークロードを移行した際に発生します。

ユーザーの移行パターン

あるサービス(OpenAIなど)が利用できなくなると、ユーザーはClaudeやGrokなどの代替手段に移行したことが観察者によって確認されました。この突然のトラフィックの急増が残りの機能しているサービスに過負荷を与え、その後のキャパシティ制約や503エラーにつながった可能性があります。

自動化されたフォールバックメカニズム

技術的な議論では、AIを統合した多くのアプリケーションが、1つのプロバイダーが障害を起こした際にプロバイダーを切り替えるための自動ルーティングを使用していることが強調されました。あるユーザーが次のように述べています。

AIを使用するアプリケーションを構築する場合、アプリケーションのさまざまな部分に対して多くのプロバイダーとモデルを設定し、さまざまなフォールバックメカニズムを備えています。あるモデルがダウンした場合、トラフィックを機能とコストが類似した別のモデルにルーティングします。総合すると、これは愚かです。

この自動化によりトラフィックの移行が加速し、単一のプロバイダーの障害がAIエコシステム全体のシステム障害に発展する可能性があります。

コミュニティの憶測と否定された理論

イベント期間中、同時ダウンタイムを説明するためにいくつかの理論が提案されました。

  • Cloudflare/DNSの問題: Downdetectorで報告されたエラーのため、多くのユーザーがCloudflareまたはAWSを疑いました。しかし、一部の報告によると、Cloudflareはその期間中に障害が発生したことを否定していました。
  • 地理的な制限: フランスの一部ユーザーはサービスが利用可能なままであったと報告し、問題が米国ベースのデータセンターに集中していた可能性を示唆しました。
  • モデルのリリース: 「Fable 5.1」のリリースがベンチマークトラフィックの急増を引き起こし、サービスに過負荷を与えたという憶測がありました。
  • 地政学的なアクター: 一部では、市場を動かすために国際的なアクターがAIブームを標的にしたという理論もありましたが、これは主にインフラ障害を支持してほとんど退けられました。

Sources

関連