goodroot/hyprwhspr
Native speech-to-text for Linux - Fast, accurate and private system-wide dictation
What it solves
Linux ユーザー向けに、ネイティブでシステム全体に対応した音声認識(STT)ディクテーションツールを提供します。音声を即座にテキストに変換し、手動で入力することなく任意のアクティブアプリケーションのバッファに貼り付けられます。
How it works
マイクから音声を取得し、複数の文字起こしバックエンドで処理します。プライバシーと速度を重視したローカルのインメモリモデルに加え、REST や WebSocket 経由で Gemini や ElevenLabs などのクラウド API も利用可能です。Wayland セッション向けに設計され、systemd ユーザーサービスと統合してバックグラウンドで動作します。
Who it’s for
Wayland 上の Linux ユーザー、特に高速でプライベートかつ高度にカスタマイズ可能なディクテーション体験を求める方に最適です。最高性能を引き出すためにハイエンド NVIDIA GPU を搭載した環境を想定していますが、onnx-asr を用いた CPU のみの構成もサポートします。
Highlights
- Flexible Backends:Cohere Transcribe、Parakeet TDT V3、Whisper、クラウド API をサポート。
- Linux Native:Wayland 用に構築され、Arch、Debian、Ubuntu、Fedora、openSUSE など複数ディストリビューションに対応。
- Automatic Integration:テキストを自動でアクティブバッファに貼り付け、録音中にシステム音量を下げるオーディオダッキング機能もオプションで提供。
- Visual Feedback:テーマ化されたビジュアライザーと OSD オーバーレイで録音状態を表示。
- Hardware Optimized:CUDA(NVIDIA)および Vulkan(AMD/Intel)アクセラレーションに最適化し、高速 CPU オプションも用意。
- Multi-lingual:英語以外の音声を英語に翻訳し、マルチランゲージでの文字起こしをサポート。