Stability-AI/stable-codec

A family of state-of-the-art Transformer-based audio codecs for low-bitrate high-quality audio coding.

해결하는 문제

고품질의 음성 인코딩 시스템을 제공하여 저비트레이트 토큰으로 음성을 압축하면서도 높은 재구성 품질을 유지합니다. 특히 음성 합성(TTS)과 같은 하류 작업에 유용한 효율적인 음성 표현의 필요성을 해결합니다.

작동 방식

이 시스템은 슬라이딩 윈도우 어텐션을 사용하는 Transformer 기반 아키텍처를 사용하여 음성을 잠재 변수와 토큰으로 인코딩합니다. 음성을 이산화하기 위해 유한 스칼라 양자화(FSQ) 브로틀넥을 사용합니다. 하류 AI 작업에서 토큰의 활용성을 향상시키기 위해, 모델은 잠재 변수에서 강제 정렬된 음소 태그를 회귀할 수 있도록 연결주의적 시계열 분류(CTC) 헤드를 사용하여 파인튜닝할 수 있습니다.

대상 사용자

음성 합성, 음성 압축, 생성형 음성 모델을 개발하는 연구자 및 개발자로, 음성을 이산 토큰으로 효율적으로 표현할 필요가 있는 분들입니다.

주요 특징

  • 유연한 비트레이트 제어: 학습 후 브로틀넥 설정을 조정하여 토큰 사전 크기와 초당 비트 수(bps)를 조절할 수 있습니다.
  • 하류 작업 최적화: stable-codec-speech-16k 버전은 TTS 응용 프로그램에서 더 나은 성능을 위해 잠재적 의미를 강화하도록 특별히 파인튜닝되었습니다.
  • 고효율 추론: 슬라이딩 윈도우 어텐션 처리를 최적화하기 위해 FlashAttention을 활용합니다.
  • 포괄적인 학습 도구: 파인튜닝 스크립트와 음소 수준 정렬을 통합하기 위한 CTC 손실 지원을 포함합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트