Aratako/Irodori-TTS

A Flow Matching-based Text-to-Speech Model with Emoji-driven Style Control

What it solves

Irodori-TTS は高忠実度テキスト音声合成(TTS)システムで、テキストから自然な音声を生成します。短い参照音声クリップからのゼロショット音声クローンや、テキストキャプション(VoiceDesign)による詳細なスタイル制御、入力テキストに基づく生成音声長さの自動推定といった柔軟な音声アイデンティティ作成の課題を解決します。

How it works

本システムは Flow Matching ベースのアーキテクチャ(Rectified Flow Diffusion Transformer)を採用し、DACVAE コーデックが提供する連続潜在表現上で動作します。以下の専門エンコーダを使用します:

  • Text Encoder:事前学習済み LLM のトークン埋め込みと transformer 層を使用。
  • Reference Latent Encoder:参照音声を処理し、特定スピーカーのアイデンティティでモデルを条件付け。
  • Caption Encoder:感情・トーン・スタイルのテキスト記述を処理し、音声表現を制御。
  • Duration Predictor:v3 に統合されたコンポーネントで、出力音声の長さを自動推定します。

Who it’s for

  • AI Audio Developers:高度な条件付け(クローンとスタイル制御)を備えた高品質 TTS の実装を目指す開発者。
  • Content Creators:新たに音声を録音せずに、特定の感情やスタイルの音声が必要なユーザー。
  • ML Researchers:音声生成における Flow Matching と Diffusion Transformer に関心のある研究者。

Highlights

  • Multi-modal Voice Design:テキスト、参照音声、キャプションを組み合わせ、音声アイデンティティと感情を精密に制御。
  • Zero-shot Voice Cloning:参照音声サンプルだけで音声をクローン可能。
  • Emoji-based Style Control:入力テキスト中の絵文字で非言語的な音声表現を影響付け。
  • PEFT LoRA Fine-Tuning:特定の声やスタイル向けのパラメータ効率的適応をサポート。
  • Speaker Inversion:再利用可能なスピーカー埋め込みトークンを学習・保存し、毎回参照音声を提供する必要を排除。
  • Automatic Watermarking:SilentCipher を統合し、自動音声透かしを実装。