텍스트 생성 추론 (TGI) 인텔 가우디 통합

Hugging Face는 인텔 가우디 하드웨어 지원을 Text Generation Inference (TGI)에 기본적으로 통합하여, 인텔의 특수 AI 가속기를 사용해 대형 언어 모델(LLM)을 프로덕션 수준 서빙 스택으로 배포할 수 있게 했습니다. 이 통합으로 별도의 포크가 필요 없으며, 가우디 사용자는 최신 TGI 기능을 즉시 이용할 수 있습니다.

통합 백엔드 아키텍처

TGI는 이제 메인 코드베이스 내에서 직접 인텔 가우디를 지원합니다 (PR #3091을 통해), 이전에 별도의 tgi-gaudi 포크를 사용해야 했던 요구사항을 대체합니다. 이 전환은 새로운 TGI 멀티 백엔드 아키텍처 덕분에 가능했으며, 사용자 경험을 간소화하고 가우디 하드웨어가 TGI 생태계에서 일등 시민으로 취급되도록 보장합니다.

지원되는 인텔 가우디 하드웨어

이 통합은 다음을 포함한 인텔 가우디 가속기 전체 라인을 지원합니다:

  • Gaudi1: AWS EC2 DL1 인스턴스를 통해 이용 가능.
  • Gaudi2: Intel Tiber AI Cloud와 Denvr Dataworks를 통해 이용 가능.
  • Gaudi3: Intel Tiber AI Cloud, IBM Cloud, 그리고 Dell, HP, Supermicro 등 OEM을 통해 이용 가능.

핵심 기능 및 프로덕션 혜택

가우디 백엔드는 TGI의 프로덕션 수준 기능을 인텔 하드웨어에 제공하여 기존 GPU 배포에 대한 대안을 제시합니다. 주요 혜택은 다음과 같습니다:

  • Production-Ready Features: 동적 배치와 스트리밍 응답 지원.
  • Deployment Flexibility: 하드웨어 다양성 증가와 특정 워크로드에 대한 매력적인 가격 대비 성능.
  • Advanced Technical Support: 다중 카드 추론(샤딩), 비전-언어 모델, FP8 정밀도 지원.

최적화된 모델 지원

Hugging Face는 인텔 가우디 하드웨어에 특화된 모델링 코드를 최적화하여 단일 및 다중 카드 구성 모두에서 성능을 극대화했습니다. 현재 가우디에 최적화된 모델은 다음과 같습니다:

  • Llama Series: Llama 3.1 (8B 및 70B), Llama 3.3 (70B), 그리고 Llama 3.2 Vision (11B).
  • Mistral/Mixtral: Mistral (7B) 및 Mixtral (8x7B).
  • Other Architectures: CodeLlama (13B), Falcon (180B), Qwen2 (72B), Starcoder/Starcoder2, Gemma (7B), Llava-v1.6-Mistral-7B, 그리고 Phi-2.

또한, Intel Neural Compressor (INC)를 통해 FP8 양자화를 지원하여 성능을 더욱 향상시킵니다.

배포 및 구현

사용자는 공식 Docker 이미지(ghcr.io/huggingface/text-generation-inference:3.2.1-gaudi)를 사용해 가우디에 TGI를 배포할 수 있습니다. 배포에는 가우디 하드웨어가 장착된 머신과 --runtime=habana 플래그가 필요합니다.

향후 업데이트에서는 DeepSeek-r1/v3 및 QWen-VL을 포함한 추가 모델 지원이 계획되어 있습니다.

Sources