熱気が高まっている:AWS us-east-1 のオーバーヒーティング事案を分析する

A recent report from AWS has confirmed that service disruptions in North Virginia were caused by data center overheating. 北バージニアにおけるサービス中断は、データセンターのオーバーヒーティング(過熱)が原因であったことが AWS からの最近の報告で確認されました。クラウドプロバイダーは影響を軽減するために取り組んできましたが、この事案は、インターネットの最も重要なインフラストラクチャハブである us-east-1 リージョンに関する、エンジニアやアーキテクトの間で長年続いてきた議論を再燃させました。

多くの企業にとって、us-east-1 はデフォルトのデプロイメントターゲットであり、グローバルなウェブの中心的柱となっています。しかし、このリージョンで熱暴走や冷却システムの故障といった物理的な障害が発生すると、その波及効果は単一のアベイラビリティゾーンを超えて広範囲に及ぶことがよくあります。

モダンなデータセンターにおける熱の問題

この中断の核心は、冷却の失敗にありました。理論上、データセンターの冷却は綿密に計画されたユーティリティです。容量は、設置されたハードウェアの熱出力を合わせてスケールするように設計されています。しかし、モダンなコンピューティング、特に高密度な AI ワークロードの急増は、熱エンベロープ(熱の許容範囲)を限界まで押し上げています。

コミュニティの議論では、Tier-1 の施設においてこのような事象がどのように発生するのかについて、重要な疑問が投げかけられています。潜在的な原因としては、以下のようなものが挙げられます:

  • Equipment Failure: 冷却水ループや HVAC ユニットの故障。
  • Over-provisioning: ピーク負荷時に、既存の冷却インフラがサポートできる以上のハードウェアを設置してしまう可能性。
  • External Factors: 冷却塔の設計仕様を超える極端な周囲温度。

一部の観察者は、さらに急進的なアーキテクチャの転換、例えば、大規模で安定した冷却容量を確保するために、原子力発電所で使用されるものと同様の熱交換器を利用できるよう、データセンターを海洋の近くに再配置することさえ提案しています。

「us-east-1」問題:単一障害点か?

北バージニアにおける AWS の事案でよくあることですが、コミュニティの反応は、このリージョンがシステム的なリスクとして果たす役割に強く焦点を当てました。

"AWS’s US-East 1 continues to be the Achilles heel of the Internet. And while yes building across multiple regions and AZs is a thing, AWS has had a string of issues where US-East 1 has broader impacts, which makes things far less redundant and resilient than AWS implies."

AWS は、まさにこのような障害を防ぐためにマルチアベイラビリティゾーン(AZ)アーキテクチャを推進していますが、現実はより複雑です。IAM (Identity and Access Management) や Route 53 といった多くのグローバルサービスは、歴史的に us-east-1 に深い依存関係を持っています。そこで障害が発生すると、顧客の実際のコンピューティングリソースがどこに位置しているかにかかわらず、サービス全体に影響を与える「ブラスト半径(影響範囲)」を生じさせることがあります。

理論と実装のギャップ

エンジニアリングコミュニティからの最も痛烈な批判の一つは、AWS が推奨するベストプラクティスと、実際の業界の実装との間のギャップです。AWS はマルチリージョンおよびマルチ AZ のフェイルオーバーを推奨していますが、多くの組織はこれを実際に実装することに苦労しています。

  • Complexity: ステートフルなアプリケーション(データベースなど)に対して真のマルチリージョン・フェイルオーバーを実装することは、非常に困難で高コストです。
  • The "Default" Trap: us-east-1 は非常に多くのツールや SDK でデフォルトに設定されているため、最も混雑し、頻繁にターゲットとなるリージョンであり続けています。
  • The Multi-AZ Myth: 一部のユーザーは、主要な企業がリージョン全体の事象においてダウンタイムを完全に排除できるような、シームレスなマルチ AZ フェイルオーバーを正常に実装しているのをまだ見たことがないと主張しています。

障害の技術的なニュアンス

興味深いことに、影響の範囲に関する報告には食い違いがありました。AWS は単一の AZ が影響を受けただけだと述べましたが、Coinbase のような著名な顧客は、複数の AZ が問題を経験していると主張しました。この不一致は、クラウドサービスの相互接続された性質上、よく起こります。あるゾーンでの障害が、他のゾーンにある依存サービスにおけるレイテンシやタイムアウトを引き起こし、より広範な障害が発生しているかのような錯覚を生じさせることがあるためです。

さらに、一部のアライスタは、Amazon MSK (Managed Streaming for Apache Kafka) のようなサービスにおいて、影響が特に顕著であったことに注目しました。これは、ワークロードの特定の性質や、サービスの内部アーキテクチャが熱障害の影響を悪化させた可能性を示唆しています。

結論

北バージニアのオーバーヒーティング事案は、「クラウド」が依然として物理的なハードウェアで構成されており、熱力学の法則に従うものであることを思い出させてくれます。次世代の AI を支えるためにコンピューティング密度が増加するにつれ、冷却、電力、地理といった物理インフラは、その上に載るソフトウェアレイヤーと同じくらい重要になります。アーキテクトにとって、教訓は明確です。単一のリージョン、特に us-east-1 のように不安定なものに依存することは、「マネージドサービス」のどれだけ使っても完全に排除できないリスクです。

Sources