andimarafioti/faster-qwen3-tts
Real-time text-to-speech with Qwen3-TTS
해결하는 문제
Faster Qwen3-TTS는 표준 Qwen3-TTS 모델의 높은 지연과 느린 추론 속도를 해결합니다. 실시간 텍스트-to-음성 변환을 가능하게 하여, 첫 음성 출력까지의 시간(TTFA)을 크게 단축하고 스트리밍 및 비스트리밍 음성 생성 모두에서 실시간 요소(RTF)를 향상시킵니다.
작동 방식
이 프로젝트는 torch.cuda.CUDAGraph를 사용하여 실행 그래프를 캡처함으로써 추론을 최적화하며, Flash Attention, vLLM, Triton과 같은 복잡한 종속성 없이도 작동합니다. 주로 두 가지 주요 백엔드를 지원합니다:
- Torch/CUDA-graph: NVIDIA GPU용 기본 고성능 경로.
- GGML:
qwentts.cpp런타임용 실험적 어댑터로, 양자화 추론을 가능하게 합니다.
스트리밍 중 음성 품질을 유지하기 위해, 25프레임의 왼쪽 컨텍스트를 사용하는 슬라이딩 윈도우를 통해 음성 청크를 디코드하여 경계 아티팩트를 방지합니다. 또한 In-Context Learning (ICL) 모드에서는 생성된 음성의 시작 부분에서 음소가 뒤섞이는 것을 방지하기 위해 참조 음성에 자동으로 침묵을 추가합니다.
대상 사용자
- 실시간 AI 음성 애플리케이션을 개발하는 개발자.
- NVIDIA GPU(제트슨 AGX 오린 포함)에서 최소한의 지연으로 Qwen3-TTS를 실행하고자 하는 사용자.
- OpenWebUI와 같은 도구와 통합할 수 있는 OpenAI 호환 TTS API를 원하는 사용자.
주요 특징
- 매우 빠른 성능 향상: 다양한 NVIDIA GPU에서 최대 9.8x의 RTF 향상과 6.5x의 TTFA 감소를 달성.
- 유연한 생성 모드: x-vector 또는 ICL을 통한 보이스 클로닝, 사전 정의된 스피커 ID(CustomVoice), 지시 기반 보이스 설계를 지원.
- 스트리밍 지원: 생성 중에 음성 청크를 출력하여 즉시 재생 가능.
- OpenAI 호환성:
POST /v1/audio/speech계약을 따르는 API 서버 포함. - 다중 백엔드: 네이티브 PyTorch 경로와 실험적 GGML 백엔드 모두 제공.
관련
- 프로젝트
- Dispatch
- Dispatch
- Dispatch
- Dispatch