breezeblue-ai/breeze-tts
Official PyTorch inference for Breeze TTS 2
해결하는 문제
Breeze TTS 2는 실시간으로 표현력 있는 텍스트 음성 변환(TTS) 상호작용을 위해 설계되었습니다. 자연어 지침으로 정확하게 제어할 수 있는 고품질의 저지연 오디오 생성의 필요성을 해결하여, 사용자가 광범위한 기술 설정이나 여러 참조 샘플 없이도 음성을 만들거나 수정할 수 있게 합니다.
작동 방식
이 모델은 이중 언어(영어 및 중국어) 오픈 가중치 시스템으로, 세 가지 주요 작동 모드를 지원합니다:
- 음성 복제: 참조 오디오 클립과 그 전사본을 사용하여 화자의 음색과 스타일을 복제합니다.
- 음성 디자인: 자연어 설명(예: "따뜻하고 사려 깊은 젊은 여성")만을 기반으로 완전히 새로운 음성을 생성합니다.
- 음성 방향: 참조 오디오와 특정 지침을 결합하여 복제된 음성의 톤, 감정, 속도를 조정합니다.
또한 괄호나 대괄호를 사용하여 텍스트에 직접 삽입할 수 있는 "보컬 이벤트"(웃음이나 한숨 등)를 지원합니다. 초저지연을 달성하기 위해 CUDA 그래프와 전용 디코딩 단계를 갖춘 "빠른 경로"를 활용하여 첫 오디오까지의 시간(TTFA)을 최소화합니다.
대상 사용자
이 프로젝트는 실시간 AI 음성 에이전트, 대화형 애플리케이션을 구축하는 개발자와 연구자, 그리고 영어와 중국어 모두에서 음성 전달과 감정을 정밀하게 제어해야 하는 콘텐츠 제작자를 대상으로 합니다.
주요 특징
- 지침 따르기: 자연어를 사용한 참조 없는 음성 디자인과 참조 기반 음성 방향을 지원합니다.
- 초저지연: NVIDIA H100 GPU에서 40ms 미만의 첫 오디오까지의 시간(TTFA)을 달성합니다.
- 이중 언어 지원: 단일 모델이 영어와 중국어 음성을 자연스럽게 처리합니다.
- 표현 제어:
(laugh)나(sigh)와 같은 인라인 보컬 이벤트를 삽입하여 더 인간적인 전달을 가능하게 합니다. - GPU 효율성: 즉시 추론에 약 7.7 GiB의 GPU 메모리로 작동합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트