物理破壞與區域崩潰:分析 AWS ME-CENTRAL-1 中斷
雲端基礎設施的韌性常被討論為軟體錯誤、設定失誤或局部電力故障。然而,最近在 AWS 中東(阿聯酋)區域(ME-CENTRAL-1)發生的一連串事件,強烈提醒我們:物理安全與地緣政治穩定是數位可用性的根本。最初被報導為「局部電力問題」的事件,最終升級為涉及資料中心結構損毀的區域危機,導致超過 130 項 AWS 服務中斷。
此事件為架構師與工程師提供了一個關鍵案例,說明可用區(AZ)冗餘與真正的區域災難復原之間的差異。當多個區域的物理完整性受損時,標準的「多 AZ」策略已不再足夠。
升級過程:從電力問題到實體襲擊
中斷分階段展開,AWS 的溝通隨著情況嚴重程度的明朗而演變。最初在 3 月 1 日,故障被描述為影響單一可用區(mec1-az2)的「局部電力問題」。AWS 報告稱,物體擊中資料中心,產生火花與火災,導致消防隊關閉該設施及其發電機的電源。
到 3 月 2 日,影響範圍大幅擴大。AWS 確認 ME-CENTRAL-1(阿聯酋)與 ME-SOUTH-1(巴林)區域因無人機襲擊而受到實體衝擊。阿聯酋有兩座設施直接被擊中,巴林則因附近的襲擊造成重大實體損毀。其結果慘不忍睹:
- 結構損毀: 資料中心設施直接受擊。
- 電力故障: 電力供應系統中斷。
- 次生損害: 由於滅火行動產生的水害。
多米諾效應:基礎服務崩潰
此事件最具技術意涵的收穫是 AWS 服務的依賴鏈。中斷顯示「基礎服務」的失效會在整個生態系統中引發連鎖崩潰。
S3 與 DynamoDB 瓶頸
AWS 確認 Amazon S3 與 Amazon DynamoDB 為主要的基礎服務。因為眾多其他服務(AWS Lambda、Amazon Kinesis、Amazon CloudWatch、以及 Amazon RDS)皆依賴 S3 與 DynamoDB 來取得狀態、設定或儲存資料,這些相依服務在最初的電力喪失之後仍長時間處於降級狀態。
AZ 冗餘的限制
Amazon S3 設計上能夠承受單一可用區的全部喪失。然而,日誌揭示了一個關鍵的臨界點:
"When the mec1-az2 AZ was powered off... S3 continued to operate normally. As the second AZ became impaired, S3 error rates increased. With two Availability Zones significantly impacted, customers are seeing high failure rates for data ingest and egress."
「當 mec1-az2 AZ 被切斷電源時…S3 仍能正常運作。隨著第二個 AZ 受損,S3 錯誤率上升。當兩個可用區受到顯著影響時,客戶會看到資料寫入與讀出的失敗率大幅提升。」
此證實即使 S3 具高度耐久性,其可用性仍依賴區域內最少數量的功能正常區域。當三個區域中的兩個(mec1-az2 與 mec1-az3)受損時,區域服務實質上已崩潰。
復原挑戰與緩解措施
從實體破壞中復原的方式與從軟體崩潰中復原根本不同。AWS 必須同時走兩條平行路徑:
- 實體修復: 修復結構損毀、恢復冷卻系統,並與當地主管機關協調安全重新供電。此過程估計需數個月才能完全恢復。
- 軟體層面的緩解: 部署更新,使 S3 與 DynamoDB 能在極度受限的基礎設施中運作,並透過網路層面的變更將流量導離受影響的區域。
儘管採取了上述措施,情況仍極度不穩定,以至於 AWS 前所未有地強烈建議客戶將所有資源遷移至其他區域(美國、歐洲或亞太),並從遠端備份還原,因為當前的運行環境仍「難以預測」。
更廣泛的影響與教訓
雖然提供的日誌聚焦於中東,但社群的回應凸顯了對區域集中化的長期焦慮。Hacker News 上的使用者指出,像 Coinbase 與 Modal 這樣的平台也受到波及,說明一次區域性的 AWS 故障可在 SaaS 生態系統中觸發全球性的連鎖反應。
主要架構教訓
- 多 AZ 不等於多區域: 此事件證明,物理災害可以同時抹除多個 AZ。對於關鍵工作負載而言,多區域策略是確保在區域災難期間持續運作的唯一方法。
- 備份位置: 若備份與主要工作負載存放於同一區域,當該區域遭受實體破壞時備份將毫無價值。跨區域、遠端備份是實現真正災難復原的必要條件。
- 依賴圖譜: 工程師必須了解其應用程式依賴的「基礎」服務。若您的應用依賴於一個又依賴 S3 的服務,實質上就是依賴 S3 的區域健康狀況。
總結來說,ME-CENTRAL-1 中斷是雲端運算中「黑天鵝」事件的警示範例:雲本身的實體破壞。