MisoLabsAI/MisoTTS
Miso TTS is an 8 billion, highly emotive text-to-speech model
해결하는 문제
Miso TTS 8B는 고품질의 대화형 영어 음성 생성을 위해 설계되었습니다. 사용자는 텍스트를 자연스러운 대화로 변환할 수 있으며, 이전 오디오를 조건으로 사용하여 보이스 클로닝을 수행할 수 있습니다.
작동 원리
이 모델은 Sesame CSM 아키텍처에서 영감을 받은 RVQ Transformer 아키텍처를 사용합니다. 다음 두 가지 주요 구성 요소로 이루어져 있습니다:
- 텍스트와 오디오 프레임 임베딩을 처리하는 대규모 Llama 3.2 스타일 백본 (8B 파라미터).
- 각 프레임 내에서 고차 오디오 코드북을 예측하는 소규모 자기회귀 오디오 디코더 (300M 파라미터).
Mimi 오디오 토크나이저를 활용하여 텍스트와 선택적 오디오 컨텍스트로부터 오디오 코드를 생성하며, 이를 통해 대화 이력을 유지하여 더욱 자연스러운 음성을 생성할 수 있습니다.
대상
대화형 대화 및 보이스 클로닝이 가능한 고충실도 텍스트 음성 변환 시스템이 필요하며, 고VRAM GPU(예: bfloat16 정밀도를 위한 24GB+ VRAM)를 사용할 수 있는 개발자 및 연구자.
주요 특징
- 대화 중심: 단순한 읽기가 아닌 대화 생성에 특화되어 설계되었습니다.
- 보이스 클로닝: 기존 오디오 샘플을 조건으로 하여 프롬프트 기반 생성을 지원합니다.
- 워터마킹: 안전성과 진본성을 위한 기본 워터마킹이 포함되어 있습니다.
- Llama 기반 아키텍처: 대규모 트랜스포머 백본을 활용하여 고품질 출력을 제공합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트