goodroot/hyprwhspr

Native speech-to-text for Linux - Fast, accurate and private system-wide dictation

What it solves

Linux ユーザー向けに、ネイティブでシステム全体に対応した音声認識(STT)ディクテーションツールを提供します。音声を即座にテキストに変換し、手動で入力することなく任意のアクティブアプリケーションのバッファに貼り付けられます。

How it works

マイクから音声を取得し、複数の文字起こしバックエンドで処理します。プライバシーと速度を重視したローカルのインメモリモデルに加え、REST や WebSocket 経由で Gemini や ElevenLabs などのクラウド API も利用可能です。Wayland セッション向けに設計され、systemd ユーザーサービスと統合してバックグラウンドで動作します。

Who it’s for

Wayland 上の Linux ユーザー、特に高速でプライベートかつ高度にカスタマイズ可能なディクテーション体験を求める方に最適です。最高性能を引き出すためにハイエンド NVIDIA GPU を搭載した環境を想定していますが、onnx-asr を用いた CPU のみの構成もサポートします。

Highlights

  • Flexible Backends:Cohere Transcribe、Parakeet TDT V3、Whisper、クラウド API をサポート。
  • Linux Native:Wayland 用に構築され、Arch、Debian、Ubuntu、Fedora、openSUSE など複数ディストリビューションに対応。
  • Automatic Integration:テキストを自動でアクティブバッファに貼り付け、録音中にシステム音量を下げるオーディオダッキング機能もオプションで提供。
  • Visual Feedback:テーマ化されたビジュアライザーと OSD オーバーレイで録音状態を表示。
  • Hardware Optimized:CUDA(NVIDIA)および Vulkan(AMD/Intel)アクセラレーションに最適化し、高速 CPU オプションも用意。
  • Multi-lingual:英語以外の音声を英語に翻訳し、マルチランゲージでの文字起こしをサポート。