OpenAI MRC 다중 경로 신뢰 연결 프로토콜
OpenAI는 최첨단 AI 모델 학습에 사용되는 슈퍼컴퓨터 클러스터에서 혼잡을 제거하고 하드웨어 장애의 영향을 최소화하도록 설계된 새로운 네트워킹 프로토콜인 Multipath Reliable Connection (MRC)을 도입했습니다. AMD, Broadcom, Intel, Microsoft, NVIDIA와 협력하여 개발된 MRC는 이제 고성능 AI 네트워킹을 표준화하기 위한 Open Compute Project (OCP) 사양으로 제공됩니다.
동기식 AI 학습에서 네트워크 병목 해결
동기식 사전 학습은 수천 개의 GPU가 동시에 동작해야 하므로, 네트워크 혼잡이나 하드웨어 장애로 인한 단일 데이터 전송 지연이 전체 학습 작업을 정지시킬 수 있습니다. OpenAI의 Stargate 인프라 규모로 클러스터가 확장됨에 따라 이러한 “실패 증폭기”는 더 자주, 더 파괴적으로 나타납니다.
전통적인 네트워킹은 이 규모에서 두 가지 주요 과제에 직면합니다:
- Congestion: 여러 GPU가 동시에 동일한 목적지로 데이터를 전송할 때 피할 수 없는 병목 현상이 발생하지만, 일반적인 네트워크 혼잡은 종종 비효율적인 라우팅에서 비롯됩니다.
- Failure Impact: 기존 네트워크에서는 단일 링크 또는 스위치 장애가 학습 작업을 중단시키는 경우가 많으며, 체크포인트에서 재시작하거나 네트워크가 경로를 재계산하는 동안 수 초간 정지하게 됩니다.
MRC 아키텍처: 다중 평면 네트워크와 패킷 스프레이
다중 평면 토폴로지
네트워크 인터페이스당 단일 800Gb/s 링크를 사용하는 대신, MRC는 인터페이스를 여러 개의 작은 링크(예: 8개의 100Gb/s 링크)로 분할하여 별개의 병렬 네트워크, 즉 “평면”에 연결합니다.
이러한 아키텍처 변화로 OpenAI는 기존 800Gb/s 네트워크가 3~4계층이 필요했던 것에 비해, 단 2계층의 스위치만으로 100,000개 이상의 GPU를 연결할 수 있게 되었습니다. 계층 수 감소는 전력 소비를 낮추고, 고장 가능성이 있는 부품 수를 줄이며, 전체 네트워크 비용을 감소시킵니다.
적응형 패킷 스프레이
다중 평면 네트워크의 중복성을 활용하기 위해, MRC는 단일 경로 흐름을 패킷 스프레이로 대체합니다. 전송을 하나의 경로에 할당하는 대신, MRC는 단일 전송의 패킷을 모든 서로 다른 평면에 걸쳐 수백 개의 경로에 걸쳐 분산시킵니다.
- Out-of-Order Delivery: 패킷에는 최종 메모리 주소가 포함되어 있어, 목적지는 순서와 관계없이 도착하는 즉시 메모리에 전달할 수 있습니다.
- Load Balancing: MRC는 경로의 혼잡을 모니터링하고, 혼잡한 경로를 사용 가능한 경로와 동적으로 교체하여 네트워크 부하를 고르게 합니다.
- Failure Recovery: 패킷이 손실되면 MRC는 즉시 해당 경로 사용을 중단하고 데이터를 재전송합니다. 이후 프로브 패킷을 사용해 경로가 복구되었는지 확인합니다.
- Packet Trimming: 경로 장애와 목적지 혼잡을 구분하기 위해, 스위치는 패킷을 “트리밍”할 수 있습니다—페이로드를 제거하고 헤더만 전달하여, 경로를 실패로 표시하지 않고 명시적인 재전송 요청을 트리거합니다.
SRv6 소스 라우팅을 통한 제어 플레인 단순화
MRC는 미묘하게 실패할 때 진단이 어려운 BGP (Border Gateway Protocol)와 같은 동적 라우팅 프로토콜의 복잡성을 없앱니다.
IPv6 세그먼트 라우팅 (SRv6)을 사용하면, 송신자는 각 패킷이 따라야 할 전체 경로를 목적지 주소에 스위치 식별자 시퀀스로 직접 인코딩합니다. 스위치는 설정 시 구성된 정적 라우팅 테이블을 그대로 따라가며, 이는 절대 변경되지 않습니다. 경로가 실패하면, 송신자는 독립적으로 손실을 감지하고 해당 경로 사용을 중단하므로 스위치가 경로를 재계산할 필요가 없습니다.
실제 운영 성능 및 복원력
MRC는 현재 OpenAI의 가장 큰 NVIDIA GB200 슈퍼컴퓨터에 배포되어 있으며, 텍사스 주 애빌린에 있는 Oracle Cloud Infrastructure (OCI)와 Microsoft의 Fairwater 슈퍼컴퓨터 사이트에서도 사용됩니다.
OpenAI는 다음과 같은 실제 운영 결과를 보고했습니다:
- Zero Impact from Link Flaps: 티어-0와 티어-1 스위치 간에 분당 여러 번 발생하는 링크 플랩이 동기식 사전 학습 작업에 측정 가능한 영향을 주지 않았습니다.
- Seamless Hardware Maintenance: 티어-1 스위치는 서비스 중에도 재부팅하거나 링크를 복구할 수 있으며, MRC가 자동으로 영향을 받은 하드웨어를 우회하므로 학습 팀과 조정할 필요가 없습니다.
- Graceful Degradation: GPU 인터페이스가 8개 포트 중 하나를 잃어도 학습 작업은 지속됩니다. MRC는 실패한 평면을 피하도록 경로를 재계산하고, 동료들에게 해당 평면으로의 인바운드 트래픽 사용을 중단하도록 알리며, 이로 인해 성능 저하가 물리적 용량 손실보다 훨씬 적게 발생합니다.
주요 기술적 장점 요약
| 기능 | AI 학습에 미치는 영향 |
|---|---|
| Multi-Plane Design | 2개의 스위치 계층만으로 100k+ GPU를 연결하여 전력 및 비용을 절감합니다. |
| Packet Spraying | 핵심 혼잡을 제거하고 흐름 간 처리량 변동을 감소시킵니다. |
| SRv6 Source Routing | 복잡한 동적 라우팅을 정적 제어 플레인으로 대체하여 마이크로초 수준으로 장애를 우회합니다. |