CrispStrobe/CrispASR
C++ ggml runtime hub for multilingual ASR and TTS models: Cohere Transcribe, Parakeet TDT, Voxtral, Canary 1B v2, etc, plus universal forced alignment, and more
解決的問題
CrispASR 提供一個統一的、高效率的 C++ 引擎,用於自動語音辨識(ASR)與文字轉語音(TTS)。它消除了對複雜 Python 環境、PyTorch 或多個獨立二進位檔的需求,讓使用者能以單一可攜式可執行檔,運行數十個最先進的開源權重語音模型。
工作原理
CrispASR 作為 whisper.cpp 的延伸建構,使用 ggml C++ 執行環境來執行大量 ASR 與 TTS 架構。支援廣泛的後端(包括 OpenAI Whisper、NVIDIA Parakeet 與 Mistral Voxtral),並能從 GGUF 模型檔中自動偵測所需的後端。此引擎具有高度可攜性,可編譯為 WebAssembly 以在瀏覽器端執行,並提供 Python、Rust、Dart 與 Go 等多種語言的綁定。
適用對象
專為需要高效、離線語音轉文字與文字轉語音功能,但無需 Python 依賴的開發者與使用者設計。特別適用於建構跨平台應用(如配套的 Flutter 應用 CrisperWeaver)或透過 HTTP API 部署語音服務的場景。
主要特色
- 大規模模型支援:單一二進位檔內包含 54 個 ASR 後端與 52 個 TTS 引擎。
- 零 Python 依賴:作為獨立的 C++ 二進位檔執行,無需
pip install或 PyTorch。 - 高可攜性:支援 Windows、macOS、Linux,以及用於瀏覽器使用的 WebAssembly。
- 彈性部署:提供 CLI、整合式 HTTP 伺服器,以及多種程式語言環境的語言綁定。
- 硬體加速:內建支援 CUDA、HIP、Vulkan 與 Metal GPU 加速。
相關
- 專案
- 專案
- 專案
- 專案
- 專案