AutoArk/GPA

[AutoArk] GPA (General Purpose Audio) can do ASR, TTS and voice conversion with one tiny model!

해결하는 문제

GPA(Generic Purpose Audio)는 자동 음성 인식(ASR), 텍스트-to-음성(TTS), 음성 변환(VC)과 같은 여러 핵심 오디오 작업을 별도의 전문 모델이 아닌 하나의 통합 모델로 처리할 수 있는 필요성을 해결합니다.

작동 방식

GPA는 자기회귀형 Transformer 아키텍처를 사용하여 음성 이해와 생성을 통합합니다. 최신 버전인 GPA-v1.5는 추론 및 학습을 위한 네이티브 PyTorch 및 Hugging Face 워크플로우를 제공합니다. 배포를 위해 CLI 도구, FastAPI 서비스, 브라우저 기반 UI를 지원하는 ONNX Runtime을 제공합니다. 또한 Mac, Linux, 엣지 디바이스에서 로컬 CPU 추론에 최적화된 경량의 독립형 GPA-TTS 런타임도 제공되며, 양자화(INT4/INT8)를 통해 크기를 줄였습니다.

대상 사용자

이 프로젝트는 ASR 및 TTS에서 준SOTA(최첨단) 성능을 발휘하는 통합 오디오 모델을 원하는 AI 연구자 및 개발자, 또는 경량이고 엣지 대응 가능한 음성 클로닝 TTS 시스템을 찾는 사용자에게 적합합니다.

주요 특징

  • 통합 아키텍처: ASR와 TTS를 하나의 모델로 통합(VC는 향후 계획).
  • 준SOTA 성능: 더 큰 모델과 비교해도 ASR 및 TTS 벤치마크에서 경쟁력 있는 성능 제공.
  • 엣지 대응 TTS: 제로샷 음성 클로닝 기능을 갖춘 독립형 GPA-TTS 런타임, 선택 가능한 디코더 정밀도(INT8, FP16, FP32).
  • 광범위한 배포 지원: torch, vLLM, llama-cpp, sglang, mlx-lm와 호환됩니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트