goodroot/hyprwhspr

Native speech-to-text for Linux - Fast, accurate and private system-wide dictation

What it solves

它提供一個原生、系統級的語音轉文字(STT)口述工具,讓 Linux 使用者能即時將語音轉為文字,並直接貼入任何活動應用程式的緩衝區,無需手動輸入。

How it works

此工具從麥克風擷取音訊,並使用多種轉錄後端進行處理。支援本地、記憶體內的模型以確保隱私與速度,同時也支援透過 REST 或 WebSocket 的雲端 API(如 Gemini 與 ElevenLabs)。它專為 Wayland 會話設計,並與 systemd 使用者服務整合,以在背景執行。

Who it’s for

適用於 Linux 使用者(特別是使用 Wayland 的使用者),他們希望擁有快速、私密且高度可自訂的口述體驗,尤其是擁有高階 NVIDIA GPU 以獲得最佳效能的使用者;同時也支援僅使用 CPU 的環境(透過 onnx-asr)。

Highlights

  • Flexible Backends:支援 Cohere Transcribe、Parakeet TDT V3、Whisper 與雲端 API。
  • Linux Native:為 Wayland 打造,支援多種發行版,包括 Arch、Debian、Ubuntu、Fedora 與 openSUSE。
  • Automatic Integration:自動將文字貼入任何活動緩衝區,並提供可選的音訊降音功能,以在錄音時降低系統音量。
  • Visual Feedback:內建主題化視覺化器與 OSD 蓋層,顯示錄音狀態。
  • Hardware Optimized:針對 CUDA(NVIDIA)與 Vulkan(AMD/Intel)加速進行最佳化,亦提供高速 CPU 選項。
  • Multi-lingual:支援將非英語語音翻譯成英語,並支援多語言轉錄。