Intel Gaudi 보조 생성 지원

Hugging Face는 추측 샘플링이라고도 알려진 보조 생성을 Optimum Habana 라이브러리에 통합하여 Intel Gaudi 프로세서에서 텍스트 생성을 가속화했습니다. 이 최적화는 대규모 생성 AI 구현에서 추론 지연 시간, 인프라 비용 및 전력 소비를 감소시킵니다.

추측 샘플링을 통한 보조 생성

보조 생성은 작은 초안 모델을 사용해 여러 토큰을 예측하고, 이를 더 큰 대상 모델이 검증하기 전에 텍스트 생성을 가속화합니다. 이 과정은 다음과 같은 순환을 따릅니다:

  1. Drafting: 초안 모델이 $K$ 토큰을 생성합니다.
  2. Evaluation: 대상 모델이 이 $K$ 토큰을 평가합니다.
  3. Correction: 초안 모델의 토큰이 거부되면, 대상 모델이 다음 올바른 토큰을 생성합니다.
  4. Iteration: 과정이 반복되며, 다음 $K$ 토큰을 위해 다시 초안 모델부터 시작합니다.

이 기술은 추측 샘플링 과정에서 대상 분포가 복구되기 때문에 표준 자기회귀 샘플링과 동일한 샘플링 품질을 유지합니다. 이 방법의 효과를 결정하는 주요 요인은 초안 모델과 대상 모델의 상대적인 크기 및 초안 토큰의 수용률입니다.

Intel Gaudi에서의 기술 구현

Intel Gaudi에서 보조 생성을 구현하려면 모델 크기에 따라 서로 다른 최적화 전략을 관리해야 합니다. 구체적으로, 구현은 KV 캐싱과 양자화 모델을 활용하며, 각 모델(초안 및 대상)은 서로 다른 크기를 처리하기 위해 별도의 KV 캐시를 유지합니다.

이 기능은 이제 Optimum Habana의 일부이며, Hugging Face의 Transformers 및 Diffusers와 같은 라이브러리를 확장하여 AI 워크플로우가 Intel Gaudi 하드웨어에 완전히 최적화되도록 합니다.

성능 및 사용법

보조 생성은 일반적으로 대형 트랜스포머 기반 모델에 대해 약 2배의 속도 향상을 제공합니다. 초안 모델의 실제 수용률—즉, 결과적인 속도 향상—은 입력 텍스트에 부분적으로 의존합니다.

사용자는 Hugging Face Transformers 라이브러리의 .generate() 호출에서 assistant_model 매개변수를 사용하여 이 기능을 구현할 수 있습니다. Optimum Habana 환경에서는 텍스트 생성 예제에서 --assistant_model 명령줄 매개변수를 통해 이 기능이 트리거됩니다.

하드웨어 맥락

Intel Gaudi 프로세서는 고성능 추론을 위한 비용 효율적인 대안으로 자리매김하고 있습니다. Hugging Face에 따르면, Intel Gaudi는 Nvidia H100 GPU와 유사한 성능을 제공하면서 Nvidia A100 80GB GPU와 비슷한 가격대를 유지합니다.

Sources