OpenAI、Claude 與 Grok 同時發生故障
多供應商 AI 故障概述
幾項領先的 AI 平台同時遭遇服務中斷,包括 OpenAI、Claude (Anthropic) 與 Grok (xAI)。雖然最初的推測指向廣泛的 DNS 或 Cloudflare 問題,但證據顯示根本原因集中在實體運算基礎設施上。
根本原因:xAI Memphis 運算中心故障
此次中斷的主要原因是位於 Memphis 的 xAI 運算中心發生故障。xAI 正式承認了此事件,並表示:
我們對於您在今天早上我們的 Memphis 運算中心發生故障後,在使用 Grok 時可能遇到的問題深表歉意。我們也想向受影響的運算合作夥伴致歉。
這份聲明確認了 Memphis 設施不僅為 Grok 提供運算資源,也為其他「運算合作夥伴」提供資源,這解釋了為什麼多個獨立的 AI 供應商會同時經歷故障。
理論上的連鎖反應與「驚群效應」
除了實體基礎設施故障外,社群分析指出,當使用者在平台之間遷移時,發生了次級的「連鎖」效應。這種現象被稱為「驚群效應」(thundering herd) 問題,發生在大量使用者同時將工作負載轉移到備援供應商時。
使用者遷移模式
觀察者注意到,當一項服務(例如 OpenAI)變得無法使用時,使用者會遷移到 Claude 或 Grok 等替代方案。這種流量的突然激增很可能導致剩餘的功能性服務超載,進而導致隨後的容量限制與 503 錯誤。
自動化備援機制
技術討論強調,許多整合 AI 的應用程式使用自動化路由來在供應商故障時切換供應商。正如一位使用者所言:
如果你開發一個使用 AI 的應用程式,你會為應用程式的不同部分配置許多供應商與模型,並設有多種備援機制。當一個模型停機時,你會將流量路由到另一個在能力/成本上相似的模型。總結來說,這很愚蠢。
這種自動化加速了流量的轉移,潛在性地將單一供應商的故障轉化為整個 AI 生態系統的系統性故障。
社群推測與被駁回的理論
在事件期間,提出了幾種理論來解釋同時停機的現象:
- Cloudflare/DNS 問題: 許多使用者因 Downdetector 上的錯誤報告而懷疑 Cloudflare 或 AWS。然而,一些報告指出 Cloudflare 否認在該期間發生了故障。
- 地理限制: 法國的部分使用者報告服務仍然可用,這表明問題可能集中在以美國為基礎的數據中心。
- 模型發佈: 有推測認為「Fable 5.1」的發佈導致基準測試流量激增,進而使服務超載。
- 地緣政治參與者: 有人理論化認為國際參與者針對 AI 熱潮進行操作以移動市場,儘管這在很大程度上被基礎設施故障的說法所駁回。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch