homelab-00/TranscriptionSuite
A fully local and private Speech-To-Text app, offering multiple model backends, diarization & calendar mode - Available for Windows, macOS & Linux
What it solves
TranscriptionSuite 提供一個完全本地、私密的語音轉文字解決方案。它透過在使用者自己的硬體上直接執行高效能的轉錄與說話者辨識模型,消除將敏感音訊資料傳送至雲端服務的需求,支援 Windows、macOS 與 Linux。
How it works
此專案由一個基於 Electron 的儀表板(前端)與一個基於 Python 的伺服器(後端)組成。它支援多種 Speech‑To‑Text(STT)後端,包括 Whisper(透過 faster‑whisper 與 whisper.cpp)、NVIDIA NeMo(Parakeet 與 Canary)以及 VibeVoice‑ASR。
依硬體不同,會使用不同的加速路徑:
- NVIDIA GPUs:透過 Docker 的 CUDA 加速。
- Apple Silicon:原生 Metal/MLX GPU 堆疊。
- AMD/Intel GPUs:Vulkan 支援(透過 whisper.cpp)。
- CPU:所有平台的備援模式。
它也整合 PyAnnote 或 VibeVoice 進行說話者分段(辨識誰在說話),並提供「Audio Notebook」模式,讓使用者可使用任何相容 OpenAI 的 LLM 供應商與筆記對話。
Who it’s for
此工具設計給需要高隱私轉錄工作流程的使用者,例如記者、研究人員,或任何想要在本機上使用「Audio Notebook」進行口述與會議筆記、且不依賴雲端服務的人。
Highlights
- 100% 本地:音訊永不離開機器;網路僅用於最初的模型下載。
- 多後端支援:相容 Whisper、NVIDIA NeMo 與 VibeVoice‑ASR。
- 說話者分段:辨識錄音中的不同說話者。
- 彈性輸入:支援長時間錄音(麥克風或系統音訊)、即時實時轉錄,以及匯入既有音訊檔案。
- Audio Notebook:以行事曆為基礎的檢視,具備全文搜尋與 AI 助手查詢筆記功能。
- 跨平台:原生支援 Apple Silicon(Metal)、NVIDIA(CUDA)與 AMD/Intel(Vulkan)。