Stability-AI/stable-codec

A family of state-of-the-art Transformer-based audio codecs for low-bitrate high-quality audio coding.

何を解決するか

高品質な音声符号化システムを提供し、低ビットレートのトークンに音声を圧縮しながら、高品質な再構成を維持します。特に、音声合成(TTS)などの下流タスクに有用な効率的な音声表現のニーズに対応しています。

動作方法

このシステムは、スライディングウィンドウアテンションを用いたTransformerベースのアーキテクチャを使用して、音声を潜在変数とトークンにエンコードします。音声を離散化するために、有限スカラー量子化(FSQ)ボトルネックを採用しています。下流AIタスクにおけるトークンの使いやすさを向上させるために、モデルは接続主義的時系列分類(CTC)ヘッドを使用して、潜在変数から強制的に整列された音素タグを回帰するようにファインチューニングできます。

対象ユーザー

音声合成、音声圧縮、生成音声モデルに取り組んでいる研究者や開発者で、音声を離散トークンとして効率的に表現する必要がある方々。

特徴

  • 柔軟なビットレート制御: 学習後のボトルネック設定を後から調整可能で、トークン辞書のサイズや秒あたりビット数(bps)を変更できます。
  • 下流タスク最適化: stable-codec-speech-16kバリアントは、TTSアプリケーションでのパフォーマンス向上を目的に、潜在変数の意味情報を強化するように特別にファインチューニングされています。
  • 高効率な推論: スライディングウィンドウアテンションの最適化処理にFlashAttentionを活用しています。
  • 包括的な学習ツール: ファインチューニング用スクリプトと、音素レベルの整列を統合するためのCTC損失のサポートを提供しています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト