descriptinc/descript-audio-codec
State-of-the-art audio codec with 90x compression factor. Supports 44.1kHz, 24kHz, and 16kHz mono/stereo audio.
해결하는 문제
Descript Audio Codec (.dac)는 음질을 희생하지 않고 파일 크기를 크게 줄이는 고정밀 음성 압축을 제공합니다. 다양한 음성 영역(예: 대화, 음악, 환경음)에서 작동하는 유니버설 코덱의 필요성을 해결하며, 매우 낮은 비트레이트를 유지합니다.
작동 방식
이 프로젝트는 개선된 RVQGAN(Residual Vector Quantized Generative Adversarial Network)을 사용하여 44.1 kHz 음성을 이산 코드로 압축합니다. 이를 통해 약 90배의 압축 비율을 달성하고, 목표 비트레이트는 8 kbps입니다. AudioLMs, MusicLMs와 같은 음성 언어 모델링 응용 프로그램에서 EnCodec 등의 다른 코덱의 즉시 대체로 사용할 수 있습니다.
대상 사용자
- AI 연구자 및 개발자: MusicGen이나 AudioLMs와 같은 생성형 음성 모델을 구축하고 있으며, 고품질이고 효율적인 음성의 이산 표현이 필요한 사람.
- 음성 엔지니어: 고압축, 고정밀 신경망 음성 코덱을 찾는 사용자.
주요 특징
- 고압축: 44.1 kHz 음성에 대해 약 90배의 압축을 8 kbps에서 달성.
- 일반적 적용: 대화, 음악, 환경 음성 모두에서 작동 가능.
- 유연한 샘플링 속도: 16 kHz, 24 kHz, 44.1 kHz에 대한 네이티브 가중치 지원.
- 통합 준비 완료: 음성 언어 모델링을 위한 EnCodec의 즉시 대체로 설계됨.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- Dispatch