Hugging Face 추론 엔드포인트: 빠른 Whisper 전사
Hugging Face는 Inference Endpoints에서 OpenAI Whisper에 대한 새로운 배포 옵션을 출시했으며, 이전 버전에 비해 최대 8배의 성능 향상을 제공합니다. 이 업데이트를 통해 사용자는 커뮤니티 중심 접근 방식을 활용하여 오픈소스 최적화를 이용한 전용이며 비용 효율적인 전사 모델을 배포할 수 있습니다.
최적화된 추론 스택
새로운 Whisper 엔드포인트는 vLLM 프로젝트에 의해 구동되며, 다양한 하드웨어 계열에서 효율적인 모델 실행을 가능하게 합니다. 특히 NVIDIA GPU 중 컴퓨팅 능력 8.9 이상(Ada Lovelace)인 L4 및 L40과 같은 GPU를 목표로 합니다.
이러한 성능 향상을 달성하기 위해, 스택은 세 가지 주요 소프트웨어 최적화를 사용합니다:
- PyTorch 컴파일 (
torch.compile): Just-In-Time(JIT) 방식으로 최적화된 커널을 생성하여 시스템이 계산 그래프를 수정하고 연산 순서를 재배열할 수 있게 합니다. - CUDA 그래프: 순차 연산을 기록하고 이를 더 큰 작업 단위로 묶음으로써 GPU 스케줄링 오버헤드, 데이터 이동 및 동기화를 감소시킵니다.
- Float8 KV 캐시: 활성화를 동적으로 양자화하여 메모리 요구량을 줄입니다. 계산은
bfloat16(반 정밀도)으로 수행되지만, 출력은float8(1바이트,bfloat16은 2바이트)으로 저장되어 KV 캐시에 더 많은 요소를 저장할 수 있게 함으로써 캐시 적중률을 높입니다.
성능 벤치마크
평가는 bfloat16을 사용한 단일 L4 GPU에서 언어, 빔 크기, 배치 크기에 대한 일관된 디코딩 설정으로 수행되었습니다. 벤치마크는 Whisper Large V3, Whisper Large V3‑Turbo, Distil‑Whisper Large V3.5 세 모델에 초점을 맞추었습니다.
전사 품질
전사 정확도는 Open ASR Leaderboard의 여덟 개 표준 데이터셋(AMI, GigaSpeech, LibriSpeech(클린 및 기타), SPGISpeech, Tedlium, VoxPopuli, Earnings22)을 사용해 단어 오류율(WER)로 측정되었습니다. 결과는 세 Whisper 변형 모두 Transformers 라이브러리 기준과 비교해 유사한 WER 성능을 유지함을 보여주며, 속도가 빨라졌음에도 전사 품질이 손실되지 않음을 의미합니다.
실행 효율성
rev16 장시간 데이터셋(45분 이상 오디오 구간)을 사용해 Hugging Face는 실시간 계수(RTFx)—오디오 길이와 전사 시간의 비율—를 측정했습니다. Whisper Large V3는 이전 구현에 비해 RTFx가 거의 8배 향상되었습니다.
배포 및 구현
사용자는 모델을 선택하고 매개변수를 구성하여 Hugging Face Endpoints를 통해 ASR(자동 음성 인식) 추론 파이프라인을 배포할 수 있습니다.
Python 구현 예시
배포된 엔드포인트에 간단한 HTTP 요청을 사용해 추론을 수행할 수 있습니다. 아래는 배포된 체크포인트를 테스트하기 위한 구현 예시입니다:
import requests
ENDPOINT_URL = "https://<your‑hf‑endpoint>.cloud/api/v1/audio/transcriptions"
HF_TOKEN = "hf_xxxxxxxxxxxxxxxxxxxxxxxxxxxxx"
AUDIO_FILE = "sample.wav"
headers = {"Authorization": f"Bearer {HF_TOKEN}"}
with open(AUDIO_FILE, "rb") as f:
files = {"file": f.read()}
response = requests.post(ENDPOINT_URL, headers=headers, files=files)
response.raise_for_status()
print("Transcript:", response.json()["text"])
실시간 애플리케이션
이러한 엔드포인트의 속도 향상은 실시간 전사 애플리케이션 개발을 가능하게 합니다. Hugging Face는 FastRTC로 구축된 데모를 통해 이 기능을 강조했으며, 사용자는 마이크에서 실시간으로 음성을 전사할 수 있습니다.