Intel Gaudi 2와 Intel Xeon을 활용한 비용 효율적인 엔터프라이즈 RAG 애플리케이션 구축

Intel Gaudi 2 AI 가속기와 Intel Xeon CPU를 결합하면 엔터프라이즈 Retrieval-Augmented Generation (RAG) 애플리케이션을 위한 비용 효율적인 하드웨어 기반을 제공합니다. Open Platform for Enterprise AI (OPEA)를 활용함으로써 개발자는 성능을 크게 희생하지 않으면서 총 소유 비용(TCO)을 최적화하는 RAG 파이프라인을 배포할 수 있습니다.

RAG를 위한 하드웨어 아키텍처

효율적인 RAG 아키텍처는 임베딩 과정과 대형 언어 모델(LLM) 추론을 분리하여 서로 다른 컴퓨팅 요구사항에 최적화합니다:

  • Embedding Model: Intel Granite Rapids CPU에서 실행됩니다. 이 아키텍처는 고코어 성능에 민감한 워크로드를 위해 설계되었으며, 혼합 AI 워크로드에서 2-3배 성능 향상을 제공하는 AMX-FP16 명령어 세트를 지원합니다.
  • LLM Inference: Intel Gaudi 2 가속기에서 실행됩니다. Gaudi 2는 데이터 센터와 클라우드 환경에서 딥러닝 학습 및 추론을 위해 특화되었습니다.

소프트웨어 스택 및 통합

Intel은 OPEA (Open Platform for Enterprise AI) 프레임워크와 LangChain을 활용하여 RAG 애플리케이션 배포를 간소화합니다. 기술 구현은 여러 핵심 구성 요소를 포함합니다:

벡터 데이터베이스 및 임베딩

시스템은 LangChain의 rag-redis 템플릿을 사용하고, BAAI/bge-base-en-v1.5 임베딩 모델과 Redis를 벡터 데이터베이스로 활용합니다. 이를 통해 도메인 특화 데이터(예: 재무 보고서)를 검색 가능한 벡터 스토어에 삽입할 수 있습니다.

TGI를 통한 LLM 배포

LLM은 Hugging Face Text Generation Inference (TGI) 서버를 사용하여 Gaudi 2에 배포됩니다. 이 설정은 Llama, Mistral, Intel NeuralChat 등 인기 있는 오픈소스 모델을 지원합니다.

  • Quantization: FP8 양자화를 활성화하면 BF16에 비해 1.8배의 처리량 증가를 얻을 수 있습니다.
  • Scaling: 더 큰 모델(예: 70B 파라미터)은 --sharded true--num_shard 매개변수를 사용하여 여러 가속기에 분산시킬 수 있습니다.
  • Safety: 콘텐츠 검열은 Meta Llama Guard 모델을 사용하여 통합할 수 있습니다.

성능 및 비용 분석

4개의 Intel Gaudi 2 가속기와 4개의 Nvidia H100 GPU에서 16명의 동시 사용자를 대상으로 Llama2-70B 모델을 비교한 벤치마크는 비용 효율성에서 큰 차이를 보여줍니다:

  • Throughput: H100 기반 시스템은 Gaudi 2 시스템보다 1.13배 높은 처리량을 달성합니다.
  • Performance per Dollar: Gaudi 2 시스템은 훨씬 높은 가치를 제공하며, H100 시스템은 Gaudi 2 대비 성능당 비용이 0.44배에 불과합니다.

이 결과는 H100이 원시 처리량에서 약간의 우위를 가질 수 있지만, Intel Gaudi 2가 엔터프라이즈 규모 RAG 배포에 대해 더 유리한 총 소유 비용을 제공한다는 것을 나타냅니다.

기술 사양

Gaudi 2 구성

  • Hardware: HLS-Gaudi2, 8개의 Habana Gaudi2 HL-225H 메자닌 카드, 2개의 Intel Xeon Platinum 8380 CPU, 1TB 시스템 메모리.
  • OS: Ubuntu 22.04.03.

H100 구성

  • Hardware: Lambda labs 인스턴스 gpu_8x_h100_sxm5, 8xH100 SXM, 2개의 Intel Xeon Platinum 8480 CPU, 1.8TB 시스템 메모리.
  • OS: Ubuntu 20.04.6 LTS.

Intel Xeon 구성

  • Hardware: 사전 생산 Granite Rapids 플랫폼, 2Sx120C @ 1.9GHz, 8800 MCR DIMM, 1.5TB 시스템 메모리.
  • OS: CentOS 9.

Sources