OpenAI、Claude 和 Grok 同时发生故障

多供应商 AI 故障概述

一场同步的服务中断影响了包括 OpenAI、Claude (Anthropic) 和 Grok (xAI) 在在内的多个领先 AI 平台。虽然最初的推测指向广泛的 DNS 或 Cloudflare 问题,但证据表明根本原因集中在物理计算基础设施上。

根本原因:xAI Memphis 计算中心故障

中断的主要原因是位于 Memphis 的 xAI 计算中心发生故障。xAI 官方承认了这一事件,并表示:

我们对您今早因我们 Memphis 计算中心发生故障而可能在 Grok 中遇到的问题深表歉意。我们也想向受影响的计算合作伙伴道歉。

这一声明确认了 Memphis 设施不仅为 Grok 提供计算资源,还为其他“计算合作伙伴”提供资源,这解释了为什么多个独立的 AI 提供商会同时经历故障。

理论上的级联故障与“惊群效应”

除了物理基础设施故障外,社区分析表明,随着用户在平台之间迁移,发生了次生的“级联”效应。这种现象被称为“惊群效应”(thundering herd),即当大量用户同时将工作负载转移到备用提供商时就会发生。

用户迁移模式

观察者注意到,当一个服务(例如 OpenAI)变得不可用时,用户会迁移到 Claude 或 Grok 等替代方案。这种流量的突然激增很可能导致了剩余功能正常的服务的过载,从而导致随后的容量限制和 503 错误。

自动化回退机制

技术讨论强调,许多集成了 AI 的应用程序使用自动化路由来在某个提供商故障时切换提供商。正如一位用户所言:

如果你构建一个使用 AI 的应用程序,你会为应用程序的不同部分配置许多提供商和模型,并设置各种回退机制。当一个模型宕机时,你会将流量路由到另一个在能力/成本上相似的模型。总的来说,这很愚蠢。

这种自动化加速了流量的转移,可能将单个提供商的故障转变为整个 AI 生态系统的系统性故障。

社区推测与被证伪的理论

在事件期间,提出了几种理论来解释同步的停机时间:

  • Cloudflare/DNS 问题: 由于 Downdetector 上报告的错误,许多用户怀疑是 Cloudflare 或 AWS。然而,一些报告表明 Cloudflare 否认在该期间发生过故障。
  • 地理限制: 法国的某些用户报告称服务仍然可用,这表明问题可能集中在美国的数据中心。
  • 模型发布: 有推测认为“Fable 5.1”的发布导致了基准测试流量的激增,从而使服务过载。
  • 地缘政治参与者: 有人理论化称国际参与者针对 AI 热潮以操纵市场,尽管这在很大程度上被基础设施故障的解释所采纳,而后者被认为更具说服力。

Sources

相关