transcribe.cpp: 一個高效能的 C/C++ 語音轉文字推理函式庫,支援數十種模型家族和 GPU 加速

transcribe.cpp: 一個高效能的 C/C++ 語音轉文字推理函式庫,支援數十種模型家族和 GPU 加速

它解決的問題

transcribe.cpp 是一個高效能的 C/C++ 語音轉文字 (STT) 推理函式庫,設計用於在各種硬體平台上運行多樣的模型家族。它提供了一種統一的方式,在硬體加速下執行轉錄模式,減少對重量級框架的依賴,同時保持高準確度(經過 WER 測試)。

它是如何運作的

該函式庫使用 ggml 執行時期和 GGUF 模型格式來進行推理。它支援多種硬體後端以實現快速的 GPU 加速,包括 Metal (Apple Silicon)、Vulkan (Linux/Windows) 和 CUDA (NVIDIA),此外還有經由 tinyBLAS 加速的 CPU 路徑。它包含用於將 NVIDIA NeMo 檢查點轉換為 GGUF 以及將模型進行量化以減少大小的工具(例如 Q4_K_M、Q8_0)。

適合對象

需要在不同作業系統和硬體上將快速的本地語音轉文字功能整合到他們應用程式中的開發者,以及那些尋找輕量級、可攜帶的 ASR 模型推理引擎的人。

特色

  • 廣泛模型支援:支援 16 個模型家族和超過 60 個變體,包括 Whisper、Parakeet、Canary 和 Qwen3-ASR。
  • 跨平台加速:原生支援 Metal、Vulkan 和 CUDA 後端。
  • 高保真:每個已發布的模型都經過數值驗證,並參考實作進行 Word Error Rate (WER) 測試。
  • 多語言繫結:提供官方的 Python、TypeScript/JavaScript、Rust 和 Swift 繫結。
  • 彈性推理:支援串流和批次轉錄。

Sources