Amazon SageMaker에서의 Llama 2 벤치마크

Hugging Face는 Amazon SageMaker에서의 Llama 2에 대해 60개 이상의 배포 구성을 분석하는 포괄적인 벤치마크를 발표했습니다. 이 분석은 비용 효율성, 최대 처리량, 최소 지연 시간 중 무엇을 우선시하는지에 따라 조직이 생성형 AI 배포를 최적화할 수 있는 데이터 기반 권장 사항을 제공합니다.

배포 인프라 및 방법론

이 벤치마크는 Text Generation Inference(TGI)로 구동되는 Hugging Face LLM 추론 컨테이너를 사용합니다. TGI는 동적 배칭과 텐서 병렬 처리를 통해 고성능 텍스트 생성을 가능하게 하는 오픈소스 솔루션입니다.

벤치마크 파라미터

실제 세계 성능을 평가하기 위해 Hugging Face는 다음과 같은 변수에 걸쳐 Llama 2의 세 가지 모델 크기(7B, 13B, 70B 매개변수)를 테스트했습니다.

  • 인스턴스 유형: NVIDIA A10G GPU(g5.2xlarge, g5.12xlarge, g5.48xlarge)와 NVIDIA A100 40GB GPU(p4d.24xlarge).
  • 부하 수준: 동시 요청 볼륨 1, 5, 10, 20.
  • 양자화: 표준 가중치와 GPTQ 4-bit 양자화를 사용하여 성능을 비교했습니다. GPTQ는 모델 가중치를 32비트에서 3-4비트로 줄여 메모리 요구 사항을 크게 낮추고, 단일 GPU에서 Llama 2 13B와 같은 더 큰 모델을 실행할 수 있게 합니다.

성능 지표

성능은 두 가지 주요 지표를 사용하여 측정되었습니다.

  • 처리량: 초당 생성된 토큰 수.
  • 지연 시간: 단일 토큰을 생성하는 데 필요한 시간(토큰당 밀리초로 측정).

최적 배포 권장 사항

벤치마크 결과를 바탕으로, Hugging Face는 비즈니스 목표에 따라 세 가지 주요 배포 전략을 식별합니다.

가장 비용 효율적인 배포

토큰당 비용을 최소화하려는 사용자에게 GPTQ 양자화가 가장 효과적인 전략입니다. 이를 통해 단일 GPU 인스턴스에서 Llama 2 13B를 배포할 수 있습니다.

모델 양자화 인스턴스 동시 요청 수 지연 시간 (ms/토큰) 처리량 (토큰/초) 비용 ($/시간) 100만 토큰당 비용
Llama 2 7B GPTQ g5.2xlarge 5 34.25 120.09 $1.52 $3.50
Llama 2 13B GPTQ g5.2xlarge 5 56.24 71.71 $1.52 $5.87
Llama 2 70B GPTQ ml.g5.12xlarge 5 138.35 33.33 $7.09 $59.08

최대 처리량 배포

초당 처리할 토큰 볼륨을 최대화하려면 고성능 GPU 인스턴스와 높은 동시성이 필요합니다. 기록된最高 전체 처리량은 ml.p4d.12xlarge 인스턴스에서의 Llama 2 13B에 대해 688 토큰/초였습니다.

모델 양자화 인스턴스 동시 요청 수 지연 시간 (ms/토큰) 처리량 (토큰/초) 비용 ($/시간) 100만 토큰당 비용
Llama 2 7B None ml.g5.12xlarge 20 44.00 449.94 $7.09 $3.97
Llama 2 13B None ml.p4d.12xlarge 20 67.40 668.02 $37.69 $15.67
Llama 2 70B None ml.p4d.24xlarge 20 59.80 321.54 $37.69 $32.56

최소 지연 시간 배포

채팅 인터페이스와 같은 실시간 애플리케이션에서는 단일 토큰을 생성하는 시간을 최소화하는 것이 중요합니다. 최저 지연 시간은 ml.g5.12xlarge 인스턴스에서의 Llama 2 7B에서 달성되었습니다.

모델 양자화 인스턴스 동시 요청 수 지연 시간 (ms/토큰) 처리량 (토큰/초) 비용 ($/시간) 100만 토큰당 비용
Llama 2 7B None ml.g5.12xlarge 1 16.81 61.46 $7.09 $32.05
Llama 2 13B None ml.g5.12xlarge 1 21.00 47.16 $7.09 $41.76
Llama 2 70B None ml.p4d.24xlarge 1 41.35 24.51 $37.69 $427.05

결론

이 벤치마크는 Amazon SageMaker에서의 Llama 2 배포 효율성이 양자화와 인스턴스 유형 선택에 크게 의존함을 보여줍니다. GPTQ 4-bit 양자화는 비용 효율적인 배포의 진입 장벽을 크게 낮추며, 높은 처리량을 달성하려면 고성능 NVIDIA A100 인스턴스가 필요합니다.

Sources