Hugging Face Text Generation Inference (TGI) 멀티 백엔드 지원

Hugging Face는 Text Generation Inference (TGI)에 멀티 백엔드 아키텍처를 도입하여, 사용자가 단일 통합 프론트엔드를 통해 대형 언어 모델(LLM)을 배포하면서 하드웨어와 성능 요구에 따라 다양한 실행 엔진 간에 전환할 수 있도록 합니다. 이 업데이트는 TGI가 여러 전문 백엔드를 통합하는 계층 역할을 수행하도록 허용함으로써 추론 생태계의 파편화 문제를 해결합니다.

다양한 추론 엔진을 위한 통합 프론트엔드

TGI는 이제 다양한 추론 솔루션과 통합할 수 있는 모듈러 아키텍처를 지원합니다. 이 접근 방식은 사용자가 엔진을 전환할 때 별도의 백엔드를 수동으로 구성하거나, 다른 라이선스를 관리하거나, 인프라를 다시 구축할 필요가 없도록 합니다. 일관된 사용자 경험을 제공함으로써 TGI는 개발자가 기본 배포 인터페이스를 변경하지 않고 특정 모델이나 하드웨어에 대한 성능을 최적화할 수 있도록 합니다.

기술 아키텍처: Rust 백엔드 트레이트

TGI는 Rust와 Python의 조합으로 구축됩니다. 시스템은 Python Global Interpreter Lock(GIL)을 우회하여 메모리 안전성, 정적 분석 및 높은 동시성을 보장하기 위해 HTTP 및 스케줄링 계층에 Rust를 활용합니다.

멀티 백엔드 지원을 활성화하기 위해 TGI 팀은 새로운 Rust trait Backend를 구현했습니다. 이 인터페이스는 HTTP 서버와 스케줄러를 분리하여 들어오는 요청을 다양한 모델링 및 실행 엔진으로 라우팅할 수 있는 모듈러 시스템을 만듭니다. 이 트레이트는 TGI 생태계에 새로운 추론 백엔드를 통합하는 기초 메커니즘 역할을 합니다.

2025 백엔드 로드맵

Hugging Face는 2025년 내내 다양한 전문 백엔드를 TGI에 통합하기 위해 여러 파트너와 협력하고 있습니다:

  • NVIDIA TensorRT-LLM: NVIDIA GPU에 최적화된 성능을 제공하기 위해 NVIDIA와의 협업을 통해, optimum-nvidia와 통합되어 TensorRT 호환 아티팩트의 양자화, 빌드, 평가를 수행합니다.
  • vLLM: TGI 백엔드로 vLLM 통합은 2025년 1분기에 계획되어 있습니다.
  • Llama.cpp: Intel, AMD, ARM CPU 서버를 위한 강력한 CPU 기반 배포 옵션을 제공하기 위해 llama.cpp 팀과의 협업을 진행합니다.
  • AWS Neuron: AWS와의 협업을 통해 Inferentia 2 및 Trainium 2에 대한 네이티브 지원을 활성화합니다.
  • Google TPU: 성능 최적화를 위해 Google Jetstream 및 TPU 팀과의 협업을 진행합니다.

이러한 백엔드 기능은 Hugging Face Inference Endpoints에 직접 통합되어, 사용자는 높은 신뢰성과 성능을 갖춘 다양한 하드웨어에서 모델을 바로 배포할 수 있게 됩니다.

Sources