fishaudio/fish-speech
SOTA Open Source TTS
해결하는 문제
Fish Speech는 매우 자연스럽고 감정이 풍부하며 현실적인 발화를 생성하도록 설계된 다국어 텍스트-to-음성(TTS) 시스템입니다. 세밀한 억양과 감정을 포착하면서도 높은 음질과 빠른 추론 속도를 유지하는 음성 생성의 과제를 해결합니다. 수십 개의 언어에서 고성능을 제공합니다.
작동 방식
이 시스템은 이중 자기회귀(Dual-Autoregressive, Dual-AR) 아키텍처를 사용합니다. 대규모 '슬로우 AR'(4B 파라미터)는 시간 축을 따라 주요 의미 코드북을 예측하고, 소규모 '패스트 AR'(400M 파라미터)는 잔차 코드북을 생성하여 음향 세부 정보를 재구성합니다. 모델은 80개 이상의 언어에서 1,000만 시간 이상의 음성 데이터로 훈련되었으며, 그룹 상대 정책 최적화(GRPO) 강화 학습을 사용해 인간과 유사한 음향 선호도와 음색 유사성을 보장합니다.
대상 사용자
최신 음성 클로닝, 다중 스피커 대화 생성, 합성 음성에 대한 정밀한 감정 제어가 필요한 개발자 및 크리에이터를 위한 것입니다.
주요 특징
- 세밀한 인라인 제어:
[whisper],[excited]등 15,000개 이상의 고유한 자연어 태그를 지원하여 감정과 억양을 텍스트에 직접 삽입 가능. - 빠른 음성 클로닝: 추가 피니어튜닝 없이 10~30초의 짧은 참조 샘플로 음성 클로닝 가능.
- 다국어 지원: 음소나 언어별 전처리 없이 80개 이상의 언어를 네이티브로 지원.
- 내장형 다중 스피커 생성: 단일 참조 오디오 파일에서 스피커 ID 토큰을 사용해 하나의 생성 작업에서 여러 스피커를 처리 가능.
- 고성능: SGLang를 통해 스트리밍 최적화되어 NVIDIA H200 GPU에서 초음성 시간(~100ms)이 낮고 높은 처리량을 달성.
- 다단계 생성: 이전 대화의 맥락을 활용해 대화의 자연스러움을 향상.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트