descriptinc/descript-audio-codec

State-of-the-art audio codec with 90x compression factor. Supports 44.1kHz, 24kHz, and 16kHz mono/stereo audio.

해결하는 문제

Descript Audio Codec (.dac)는 음질을 희생하지 않고 파일 크기를 크게 줄이는 고정밀 음성 압축을 제공합니다. 다양한 음성 영역(예: 대화, 음악, 환경음)에서 작동하는 유니버설 코덱의 필요성을 해결하며, 매우 낮은 비트레이트를 유지합니다.

작동 방식

이 프로젝트는 개선된 RVQGAN(Residual Vector Quantized Generative Adversarial Network)을 사용하여 44.1 kHz 음성을 이산 코드로 압축합니다. 이를 통해 약 90배의 압축 비율을 달성하고, 목표 비트레이트는 8 kbps입니다. AudioLMs, MusicLMs와 같은 음성 언어 모델링 응용 프로그램에서 EnCodec 등의 다른 코덱의 즉시 대체로 사용할 수 있습니다.

대상 사용자

  • AI 연구자 및 개발자: MusicGen이나 AudioLMs와 같은 생성형 음성 모델을 구축하고 있으며, 고품질이고 효율적인 음성의 이산 표현이 필요한 사람.
  • 음성 엔지니어: 고압축, 고정밀 신경망 음성 코덱을 찾는 사용자.

주요 특징

  • 고압축: 44.1 kHz 음성에 대해 약 90배의 압축을 8 kbps에서 달성.
  • 일반적 적용: 대화, 음악, 환경 음성 모두에서 작동 가능.
  • 유연한 샘플링 속도: 16 kHz, 24 kHz, 44.1 kHz에 대한 네이티브 가중치 지원.
  • 통합 준비 완료: 음성 언어 모델링을 위한 EnCodec의 즉시 대체로 설계됨.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • Dispatch