GCP에서 5세대 Xeon에서의 언어 모델 성능 벤치마크

소개

이 게시물은 가벼운 에이전트형 AI 워크로드가 CPU 전용 인스턴스에서 효율적으로 실행될 수 있음을 보여주며, 두 개의 Xeon 기반 Google Cloud 가상 머신에서 텍스트 임베딩 및 생성 벤치마크를 통해 입증됩니다.

인스턴스 생성

N2 인스턴스 생성

Google Cloud에서 96 vCPU(하나의 Ice Lake 소켓)를 갖춘 N2 인스턴스를 생성하려면, N2 머신 유형 n2-standard-96를 선택하고, CPU 플랫폼을 Ice Lake로 설정한 후 OS와 스토리지 기본값을 유지하고 CREATE를 클릭하세요.

C4 인스턴스 생성

N2 코어 수와 일치하는 96 vCPU(하나의 Emerald Rapids 소켓)를 갖춘 C4 인스턴스를 생성하려면, C4 머신 유형 c4-standard-96를 선택하고, 안정적인 성능을 위해 선택적으로 모든 코어 터보를 활성화한 후 OS와 스토리지는 N2와 동일하게 유지하고 CREATE를 클릭하세요.

환경 설정

환경은 optimum‑benchmark 저장소를 클론하고, 커밋 d58bb2582b872c25ab476fece19d4fa78e190673을 체크아웃하고, Docker 이미지를 빌드하고, IPEX 지원이 포함된 optimum‑intel을 설치하고, OpenMP 스레드 친화성을 설정한 후 Hugging Face에 로그인하여 Llama 모델에 액세스함으로써 준비됩니다.

벤치마크

텍스트 임베딩 벤치마크

이 벤치마크는 시퀀스 길이 128, 배치 크기 1부터 128까지의 WhereIsAI/UAE-Large-V1 모델을 사용하며, YAML을 업데이트하여両方의 NUMA 노드에 바인딩한 후 optimum-benchmark --config-dir examples/ --config-name ipex_bert 명령을 실행합니다.

텍스트 생성 벤치마크

이 벤치마크는 입력 길이 256, 출력 길이 32, 배치 크기 1부터 64까지의 meta-llama/Llama-3.2-3B 모델을 사용하며, YAML을 업데이트하여両方의 NUMA 노드에 바인딩한 후 optimum-benchmark --config-dir examples/ --config-name ipex_llama 명령을 실행합니다.

결과 및 결론

텍스트 임베딩 결과

C4 인스턴스는 텍스트 임베딩에 대해 테스트된 모든 배치 크기에서 N2 인스턴스보다 약 10배에서 24배 높은 처리량을 제공합니다.

텍스트 생성 결과

C4 인스턴스는 텍스트 생성에 대해 N2 인스턴스보다 약 2.3배에서 3.6배 높은 처리량을 보여줍니다; 배치 크기 1에서 16에 대해 처리량 향상은 약 13배이며, 지연 시간에 큰 영향을 주지 않아 동시 쿼리 처리가 가능합니다.

결론

성능 향상은 5세대 Xeon(Emerald Rapids) CPU의 Intel AMX 및 메모리 개선에서 비롯됩니다. upcoming Granite Rapids(Xeon 6)가 Llama 3에 대해 약 2배의 추가 성능 향상을 제공할 것으로 예상됨에 따라, 저자들은 Google Cloud에서 Granite Rapids 인스턴스가 제공되는 경우를 전제로 CPU 전용으로 가벼운 에이전트형 AI 솔루션을 실행하여 호스트‑액셀러레이터 트래픽 오버헤드를 피할 수 있을 것으로 기대합니다.

Sources