descriptinc/descript-audio-codec

State-of-the-art audio codec with 90x compression factor. Supports 44.1kHz, 24kHz, and 16kHz mono/stereo audio.

何を解決するか

Descript Audio Codec (.dac) は、音質を損なうことなくファイルサイズを大幅に削減する高精細な音声圧縮を提供します。異なる音声領域(会話、音楽、環境音など)で動作する汎用コーデックの必要性を解決し、非常に低いビットレートを維持します。

動作方法

このプロジェクトは、改良されたRVQGAN(Residual Vector Quantized Generative Adversarial Network)を使用して、44.1 kHzの音声を離散コードに圧縮します。これにより、約90倍の圧縮比を達成し、ターゲットビットレートは8 kbpsです。AudioLMsやMusicLMsなどの音声言語モデルアプリケーションで、EnCodecなどの他のコーデックの即時置き換えとして使用できます。

対象ユーザー

  • AI研究者および開発者:MusicGenやAudioLMsのような生成音声モデルを構築しているが、高品質で効率的な音声の離散表現が必要な人。
  • 音声エンジニア:高圧縮・高精細なニューラル音声コーデックを探している人。

主な特徴

  • 高圧縮:44.1 kHz音声を8 kbpsで約90倍の圧縮を実現。
  • 汎用性:会話、音楽、環境音のすべてで動作可能。
  • 柔軟なサンプリングレート:16 kHz、24 kHz、44.1 kHzのネイティブ重みをサポート。
  • 統合可能:音声言語モデル用にEnCodecの即時置き換えとして設計されています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch