CrispStrobe/CrispASR

C++ ggml runtime hub for multilingual ASR and TTS models: Cohere Transcribe, Parakeet TDT, Voxtral, Canary 1B v2, etc, plus universal forced alignment, and more

해결하는 문제

CrispASR는 자동 음성 인식(ASR) 및 텍스트에서 음성으로 변환(TTS)을 위한 통합적이고 고성능의 C++ 엔진을 제공합니다. 복잡한 Python 환경, PyTorch, 또는 다양한 모델용 별도의 여러 바이너리가 필요 없으며, 하나의 포터블 실행 파일로 수십 개의 최신 오픈웨이트 음성 모델을 실행할 수 있습니다.

작동 방식

whisper.cpp의 확장으로 구축된 CrispASR는 ggml C++ 런타임을 사용하여 광범위한 ASR 및 TTS 아키텍처를 실행합니다. OpenAI Whisper, NVIDIA Parakeet, Mistral Voxtral 등 다양한 백엔드를 지원하며, GGUF 모델 파일에서 필요한 백엔드를 자동으로 감지할 수 있습니다. 이 엔진은 매우 포터블하며 WebAssembly로 컴파일되어 브라우저에서 클라이언트 측에서 실행 가능하며, Python, Rust, Dart, Go 등 다양한 언어의 바인딩도 제공합니다.

대상 사용자

Python 의존성의 부담 없이 효율적이고 오프라인으로 음성-텍스트 및 텍스트-음성 기능이 필요한 개발자 및 사용자를 위한 것입니다. 특히 크로스플랫폼 애플리케이션(예: 함께 제공되는 Flutter 앱 CrisperWeaver) 개발이나 HTTP API를 통한 음성 서비스 배포에 유용합니다.

주요 특징

  • 대규모 모델 지원: 1개의 바이너리에 54개의 ASR 백엔드와 52개의 TTS 엔진을 포함합니다.
  • Python 의존성 없음: pip install이나 PyTorch가 필요 없이 독립적인 C++ 바이너리로 실행됩니다.
  • 높은 포터블성: Windows, macOS, Linux 및 브라우저 기반 사용을 위한 WebAssembly를 지원합니다.
  • 유연한 배포: CLI, 통합 HTTP 서버, 다양한 프로그래밍 환경용 언어 바인딩을 제공합니다.
  • 하드웨어 가속: CUDA, HIP, Vulkan, Metal GPU 가속을 내장 지원합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트