FireRedTeam/FireRedTTS3
FireRedTTS3: Multilingual and Multi-Dialect Voice Cloning with Instruction-Guided Voice Design and Speech Editing
해결하는 문제
FireRedTTS3는 방대한 언어와 방언에 걸쳐 고음질 음성 클로닝을 처리하고, 자연어 지시를 통해 복잡한 음성 수정을 수행할 수 있도록 설계된 통합 음성 생성 및 편집 시스템입니다.
작동 방식
이 시스템은 의미적으로 풍부한 연속 음성 표현 기반으로 구축되어 있으며, 두 가지 전문 버전으로 제공됩니다:
- FireRedTTS3-Base: 제로샷 음성 클로닝에 중점을 두어, 짧은 참조 오디오 클립만으로도 화자의 음성을 모방할 수 있습니다.
- FireRedTTS3-Instruct: 지시 기반 모델로, '음성 디자인'(텍스트 설명에 기반해 새로운 음성 생성)과 '음성 편집'(기존 오디오를 의미적 또는 음향적으로 수정)을 가능하게 합니다.
고품질을 보장하기 위해, 로컬 도구 또는 LLM으로 구동할 수 있는 텍스트 정규화 프론트엔드를 사용하여 여러 언어에서 작성된 텍스트를 발화 형태로 변환합니다.
대상 사용자
이 프로젝트는 텍스트-to-음성(TTS), 음성 클로닝, 오디오 편집 분야에서 일하는 개발자 및 연구자에게 적합하며, 24개 언어와 21개 중국어 방언을 처리할 수 있는 다국어 시스템이 필요합니다.
주요 특징
- 광범위한 언어 지원: 24개 언어 및 21개 중국어 방언에서 제로샷 클로닝 지원.
- 지시 기반 음성 디자인: 참조 오디오 없이도 나이, 성별, 음색, 감정 등의 설명에 기반해 완전히 새로운 음성을 생성할 수 있습니다.
- 자유 형식의 음성 편집: 텍스트 지시를 통해 단어 삽입, 삭제, 교체(의미적 편집) 및 속도, 음높이, 볼륨 조정(음향적 편집)을 지원합니다.
- 고성능: Seed-TTS-eval 및 MiniMax-MLS-Test와 같은 벤치마크에서 단어 오류율(WER)과 화자 유사도 측면에서 최고 수준의 성능을 보여줍니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트