물리적 파괴와 지역 붕괴: AWS ME-CENTRAL-1 장애 분석
클라우드 인프라의 복원력은 보통 소프트웨어 버그, 구성 오류, 혹은 국지적인 전력 장애와 관련해 논의됩니다. 그러나 최근 AWS 중동(아랍에미리트) 리전(ME-CENTRAL-1)에서 발생한 일련의 사건은 물리적 보안과 지정학적 안정성이 디지털 가용성의 기반이라는 점을 강력히 상기시켜 줍니다. "국지적인 전력 문제"로 보고된 사건이 데이터 센터 구조물 손상으로 이어지며 130개가 넘는 AWS 서비스가 중단되는 지역 위기로 확대되었습니다.
이 사건은 아키텍트와 엔지니어에게 가용 영역(AZ) 중복성과 실제 지역 재해 복구 간의 차이를 보여주는 중요한 사례 연구가 됩니다. 여러 영역의 물리적 무결성이 손상될 경우, 기존의 "멀티‑AZ" 전략만으로는 충분하지 않게 됩니다.
확산: 전력 문제에서 물리적 타격까지
장애는 단계적으로 전개되었으며, 상황의 심각성이 명확해짐에 따라 AWS 커뮤니케이션도 변화했습니다. 처음에는 3월 1일에 단일 가용 영역(mec1-az2)에 국한된 "국지적인 전력 문제"로 설명되었습니다. AWS는 물체가 데이터 센터에 충돌해 스파크와 화재를 일으켰으며, 이로 인해 소방서가 시설과 발전기의 전원을 차단했다고 보고했습니다.
3월 2일까지 범위가 크게 확대되었습니다. AWS는 ME-CENTRAL-1(아랍에미리트)과 ME-SOUTH-1(바레인) 리전이 드론 공격으로 물리적 영향을 받았다고 확인했습니다. 아랍에미리트에서는 두 개 시설이 직접 타격을 받았고, 바레인에서는 인근 타격으로 상당한 물리적 손상이 발생했습니다. 그 결과는 다음과 같습니다:
- 구조물 손상: 데이터 센터 시설에 직접 타격.
- 전력 장애: 전력 공급 시스템 중단.
- 이차 손상: 화재 진압 활동으로 인한 물 피해.
도미노 효과: 기반 서비스 붕괴
이 사건에서 가장 기술적인 교훈 중 하나는 AWS 서비스 간 의존성 체인입니다. "기반 서비스"가 실패하면 생태계 전체가 연쇄적으로 붕괴됩니다.
S3와 DynamoDB 병목 현상
AWS는 Amazon S3와 Amazon DynamoDB를 주요 기반 서비스로 식별했습니다. 많은 다른 서비스(AWS Lambda, Amazon Kinesis, Amazon CloudWatch, Amazon RDS 등)가 상태, 구성 또는 저장을 위해 S3와 DynamoDB에 의존하기 때문에, 이들 서비스는 초기 전력 손실 이후에도 오랜 기간 동안 성능 저하를 겪었습니다.
AZ 중복성의 한계
Amazon S3는 단일 가용 영역 전체 손실을 견디도록 설계되었습니다. 그러나 로그는 중요한 전환점을 보여줍니다:
"When the mec1-az2 AZ was powered off... S3 continued to operate normally. As the second AZ became impaired, S3 error rates increased. With two Availability Zones significantly impacted, customers are seeing high failure rates for data ingest and egress."
"
mec1-az2AZ가 전원이 차단되었을 때... S3는 정상적으로 운영되었습니다. 두 번째 AZ가 손상되면서 S3 오류율이 증가했습니다. 두 개의 가용 영역이 크게 영향을 받게 되면, 고객은 데이터 수집 및 전송에서 높은 실패율을 경험하고 있습니다."
이는 S3가 매우 내구성이 높지만, 가용성은 리전 내 최소한의 기능적인 영역 수에 의존한다는 점을 확인시켜 줍니다. 세 개 중 두 개(mec1-az2와 mec1-az3)가 손상되자, 지역 서비스는 사실상 붕괴되었습니다.
복구 과제와 완화 방안
물리적 파괴로부터의 복구는 소프트웨어 충돌 복구와 근본적으로 다릅니다. AWS는 두 가지 병행 경로를 진행해야 했습니다:
- 물리적 복구: 구조물 손상 수리, 냉각 시스템 복구, 현지 당국과 협력해 시설에 안전하게 전력을 재공급. 전체 복구에는 몇 개월이 소요될 것으로 추정되었습니다.
- 소프트웨어 기반 완화: 제한된 인프라 내에서 S3와 DynamoDB가 동작하도록 업데이트를 배포하고, 네트워크 수준 변경을 통해 영향을 받은 영역을 우회하도록 트래픽을 라우팅.
이러한 노력에도 불구하고 불안정성이 너무 심각해 AWS는 고객에게 모든 리소스를 다른 리전(미국, 유럽, 아시아‑태평양)으로 마이그레이션하고 원격 백업에서 복구할 것을 강력히 권고했습니다. 운영 환경이 "예측 불가능"하다고 명시했습니다.
더 넓은 함의와 교훈
제공된 로그는 중동에 초점을 맞추고 있지만, 커뮤니티 반응은 지역 집중에 대한 지속적인 불안을 보여줍니다. Hacker News 사용자들은 Coinbase와 Modal 같은 플랫폼에 미치는 하위 효과를 언급하며, 지역 AWS 장애가 SaaS 생태계 전반에 걸쳐 전 세계적인 파급 효과를 일으킬 수 있음을 강조했습니다.
핵심 아키텍처 교훈
- 멀티‑AZ는 멀티‑리전이 아니다: 이번 사건은 물리적 재해가 여러 AZ를 동시에 파괴할 수 있음을 증명합니다. 미션 크리티컬 워크로드는 지역 재해 시 연속성을 보장하기 위해 멀티‑리전 전략이 필수입니다.
- 백업 위치: 기본 워크로드와 동일한 리전에 백업을 저장하면, 해당 리전이 물리적으로 파괴될 경우 백업은 무용지물이 됩니다. 원격, 교차‑리전 백업은 진정한 재해 복구를 위해 반드시 필요합니다.
- 의존성 매핑: 엔지니어는 애플리케이션이 어떤 "기반" 서비스에 의존하는지 파악해야 합니다. 앱이 S3에 의존하는 서비스에 의존한다면, 사실상 S3의 지역 건강 상태에 의존하는 것입니다.
요약하면, ME‑CENTRAL‑1 장애는 클라우드 컴퓨팅에서 "블랙 스완" 사건의 전형적인 예시이며, 클라우드 자체의 물리적 파괴를 보여줍니다.
SUMMARY: AWS 중동(아랍에미리트) 리전이 물리적 드론 공격으로 인해 겪은 대규모 장애를 상세히 살펴보며, 멀티‑리전 재해 복구의 중요성을 강조합니다.
TITLE: 물리적 파괴와 지역 붕괴: AWS ME-CENTRAL-1 장애 분석