Google Cloud C4와 Intel Xeon 6의 GPT OSS 성능

Google Cloud C4 가상 머신(VM)은 Intel Xeon 6 프로세서(Granite Rapids)로 구동되며, 이전 세대 C3 인스턴스에 비해 GPT OSS 대형 언어 모델(LLM) 추론에 대한 총 소유 비용(TCO)을 1.7배 개선합니다. 이러한 효율성은 차세대 하드웨어와 Hugging Face transformers 라이브러리의 맞춤형 소프트웨어 최적화가 결합된 결과입니다.

성능 향상 및 TCO 개선

Google Cloud C4 VM은 GPT OSS 모델을 실행할 때 C3 VM에 비해 뛰어난 처리량과 비용 효율성을 보여줍니다. 배치 크기 64에서는 C4 인스턴스가 C3 인스턴스 대비 vCPU당 1.7배의 처리량을 제공합니다. 시간당 비용이 vCPU 수에 비례해 선형적으로 증가하기 때문에, 이 성능 향상은 직접적으로 1.7배의 TCO 이점을 의미합니다. 즉, 동일한 토큰 양을 생성하려면 C3 인스턴스는 1.7배 더 많은 비용이 필요합니다.

핵심 지표는 다음과 같습니다:

  • Throughput: vCPU당 달러 기준 1.4배~1.7배 TPOT(Time Per Output Token) 처리량.
  • Cost: C3 VM에 비해 시간당 비용이 낮음.

MoE 추론을 위한 기술 최적화

GPT OSS는 오픈소스 Mixture of Experts(MoE) 모델입니다. MoE 아키텍처는 게이팅 네트워크를 사용해 입력을 특화된 "전문가" 서브 네트워크로 라우팅함으로써, 계산 비용이 선형적으로 증가하지 않으면서 모델 용량을 확장할 수 있습니다. 토큰당 활성화되는 전문가가 소수에 불과하기 때문에, 이러한 대형 모델에 대해 CPU 추론이 현실적인 옵션이 됩니다.

효율성을 더욱 높이기 위해 Intel과 Hugging Face는 transformers 라이브러리에서 전문가 실행 최적화( PR #40304 병합)를 구현했습니다. 이 최적화는 각 전문가가 라우팅된 토큰만 처리하도록 하여 중복 연산을 제거하고, 불필요한 FLOP을 없애며 전체 하드웨어 활용도를 향상시킵니다.

벤치마크 방법론 및 하드웨어

벤치마크는 제어된 반복 가능한 생성 워크로드를 사용해 Intel Xeon 6(GNR)과 4세대 Intel Xeon(SPR) 프로세서 간의 아키텍처 차이를 분리하여 측정했습니다.

하드웨어 구성

인스턴스 아키텍처 vCPUs
C3 4th Gen Intel Xeon processor (SPR) 172
C4 Intel Xeon 6 processor (GNR) 144

워크로드 매개변수

  • Model: unsloth/gpt-oss-120b-BF16
  • Precision: bfloat16
  • Input/Output Length: 1024 tokens each
  • Batch Sizes: 1, 2, 4, 8, 16, 32, 64
  • Optimizations: Determinism을 위한 Static KV cache와 SDPA(Scaled Dot Product Attention) attention 백엔드.

결론

Intel과 Hugging Face의 협업은 대형 MoE 모델을 차세대 범용 CPU에서 효율적으로 서비스할 수 있음을 보여줍니다. Google Cloud C4 VM의 Intel Xeon 6 아키텍처와 프레임워크 수준의 특정 최적화를 결합함으로써, 개발자는 대규모 LLM 추론에서 더 높은 처리량, 낮은 지연 시간, 그리고 감소된 운영 비용을 달성할 수 있습니다.

Sources