CrispStrobe/CrispASR

C++ ggml runtime hub for multilingual ASR and TTS models: Cohere Transcribe, Parakeet TDT, Voxtral, Canary 1B v2, etc, plus universal forced alignment, and more

解决的问题

CrispASR 提供一个统一的、高性能的 C++ 引擎,用于自动语音识别(ASR)和文本转语音(TTS)。它消除了对复杂 Python 环境、PyTorch 或多个独立二进制文件的需求,使用户能够在一个可移植的可执行文件中运行数十个最先进的开源权重语音模型。

工作原理

CrispASR 作为 whisper.cpp 的扩展构建,使用 ggml C++ 运行时执行大量 ASR 和 TTS 架构。它支持广泛的后端(包括 OpenAI Whisper、NVIDIA Parakeet 和 Mistral Voxtral),并能从 GGUF 模型文件中自动检测所需的后端。该引擎具有高度可移植性,可编译为 WebAssembly 以在浏览器端运行,并提供 Python、Rust、Dart 和 Go 等多种语言的绑定。

适用人群

专为需要高效、离线语音转文本和文本转语音功能但无需 Python 依赖的开发者和用户设计。特别适用于构建跨平台应用(如配套的 Flutter 应用 CrisperWeaver)或通过 HTTP API 部署语音服务的场景。

主要亮点

  • 大规模模型支持:一个二进制文件中包含 54 个 ASR 后端和 52 个 TTS 引擎。
  • 零 Python 依赖:作为独立的 C++ 二进制文件运行,无需 pip install 或 PyTorch。
  • 高可移植性:支持 Windows、macOS、Linux 以及用于浏览器使用的 WebAssembly。
  • 灵活部署:提供 CLI、集成 HTTP 服务器以及多种编程环境的语言绑定。
  • 硬件加速:原生支持 CUDA、HIP、Vulkan 和 Metal GPU 加速。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目