Optimum-NVIDIA 릴리즈 노트
Hugging Face는 NVIDIA 하드웨어에서 대형 언어 모델(LLM) 추론을 크게 가속하도록 설계된 추론 라이브러리 Optimum-NVIDIA를 소개했습니다. NVIDIA TensorRT-LLM 소프트웨어를 통합하고 float8(FP8) 포맷을 지원함으로써, 이 라이브러리는 최소한의 코드 변경만으로 최대 28배 빠른 처리량과 초당 1,200 토큰을 달성할 수 있게 합니다.
기술 기반: FP8 및 TensorRT-LLM
Optimum-NVIDIA는 float8 포맷을 활용하는 최초의 Hugging Face 추론 라이브러리이며, 이 포맷은 NVIDIA Ada Lovelace 및 Hopper 아키텍처에서 지원됩니다. 이 포맷을 NVIDIA TensorRT-LLM의 고급 컴파일 기능과 결합하면 계산 오버헤드를 크게 줄이고 추론 속도를 높일 수 있습니다.
사용자는 단일 플래그(use_fp8=True)를 사용하여 FP8 양자화를 활성화할 수 있습니다. 이를 통해 정확도를 손상시키지 않으면서 단일 GPU에서 더 큰 모델을 더 높은 속도로 배포할 수 있습니다. 라이브러리는 기본적으로 사전 정의된 보정 전략을 사용하지만, 사용자는 맞춤형 보정 데이터셋과 토크나이징을 제공하여 특정 사용 사례에 맞게 양자화를 최적화할 수 있습니다.
성능 벤치마크
성능은 두 가지 주요 지표인 First Token Latency와 Throughput을 기준으로 측정됩니다.
First Token Latency
First Token Latency(또는 First Token까지의 시간/프리필 지연)는 모델의 응답성을 결정합니다. Optimum-NVIDIA는 기본 Hugging Face transformers에 비해 최대 3.3배 빠른 First Token Latency를 제공합니다.
Throughput
Throughput는 토큰 생성 속도를 측정하며, 특히 배치된 생성 시에 중요합니다. 전체 시퀀스 길이(모든 배치의 입력 및 출력 토큰)를 기준으로 종단 간 지연을 나누어 계산하며, Optimum-NVIDIA는 기본 transformers에 비해 최대 28배 향상된 처리량을 제공합니다.
NVIDIA H200 Tensor Core GPU에 대한 초기 평가에서는 NVIDIA H100 Tensor Core GPU에 비해 LLaMA 모델의 처리량이 최대 2배 추가로 향상되는 것으로 나타났습니다.
구현 및 API
Optimum-NVIDIA는 Hugging Face 생태계와 즉시 호환되도록 설계되었습니다. 사용자는 한 줄의 코드를 수정하여 표준 transformers 라이브러리에서 optimum-nvidia로 전환할 수 있습니다:
- Pipeline API: 사용자는
from transformers.pipelines import pipeline을from optimum.nvidia.pipelines import pipeline으로 교체하고use_fp8=True를 설정하여 가속을 활성화할 수 있습니다. - Model API: 샘플링 파라미터에 대한 세밀한 제어를 위해, 사용자는
from transformers import AutoModelForCausalLM을from optimum.nvidia import AutoModelForCausalLM으로 교체할 수 있습니다.
모델 지원 및 로드맵
현재 Optimum-NVIDIA는 LLaMAForCausalLM 아키텍처와 작업에 대해 최고 성능을 제공합니다. 이는 파인튜닝된 버전을 포함한 모든 LLaMA 기반 모델이 바로 지원된다는 의미입니다.
라이브러리의 향후 업데이트에는 다음이 포함될 예정입니다:
- 다른 텍스트 생성 모델 아키텍처 및 작업에 대한 지원 확대.
- 프롬프트 스트리밍 중 처리량을 향상시키기 위한 In-Flight Batching 통합.
- 단일 GPU에서 더 큰 모델을 실행할 수 있도록 INT4 양자화 지원.