Aratako/Irodori-TTS

A Flow Matching-based Text-to-Speech Model with Emoji-driven Style Control

What it solves

Irodori-TTS는 고품질 텍스트‑음성 변환(TTS) 시스템으로, 텍스트에서 자연스러운 오디오를 생성합니다. 짧은 레퍼런스 오디오 클립을 사용한 제로샷 보이스 클로닝, 텍스트 캡션(VoiceDesign)을 통한 상세 스타일 제어, 입력 텍스트에 기반한 생성 오디오 길이 자동 추정 등 유연한 보이스 아이덴티티 생성 문제를 해결합니다.

How it works

시스템은 Flow Matching 기반 아키텍처(Rectified Flow Diffusion Transformer)를 사용하며, DACVAE 코덱이 제공하는 연속 잠재 공간 위에서 동작합니다. 여러 특화 인코더를 포함합니다:

  • Text Encoder: 사전 학습된 LLM의 토큰 임베딩과 transformer 레이어 사용.
  • Reference Latent Encoder: 레퍼런스 오디오를 처리해 특정 스피커 아이덴티티로 모델을 조건화.
  • Caption Encoder: 감정, 톤, 스타일에 대한 텍스트 설명을 처리해 음성 전달을 제어.
  • Duration Predictor: v3에 통합된 컴포넌트로, 출력 오디오 길이를 자동으로 추정합니다.

Who it’s for

  • AI Audio Developers: 고품질 TTS와 고급 조건부(클로닝 및 스타일 제어) 기능을 구현하려는 개발자.
  • Content Creators: 새로운 오디오를 녹음하지 않고도 특정 감정이나 스타일의 보이스가 필요한 사용자.
  • ML Researchers: 오디오 생성에 Flow Matching 및 Diffusion Transformer에 관심이 있는 연구자.

Highlights

  • Multi-modal Voice Design: 텍스트, 레퍼런스 스피치, 캡션을 결합해 보이스 아이덴티티와 감정을 정밀하게 제어.
  • Zero-shot Voice Cloning: 레퍼런스 오디오 샘플 하나만으로 보이스를 클론 가능.
  • Emoji-based Style Control: 입력 텍스트에 이모지를 사용해 비언어적 보컬 표현에 영향을 줌.
  • PEFT LoRA Fine-Tuning: 특정 보이스나 스타일에 대한 파라미터 효율적 적응 지원.
  • Speaker Inversion: 재사용 가능한 스피커 임베딩 토큰을 학습·저장해 매 호출마다 레퍼런스 오디오 제공을 생략.
  • Automatic Watermarking: SilentCipher를 통합해 자동 오디오 워터마킹 구현.