peteonrails/voxtype

Voice-to-text with push-to-talk for Wayland compositors

何を解決するか

Voxtype は Linux 向けのローカル音声認識ツールで、カーソル位置に直接テキストを音声入力できるようにします。クラウドベースの音声認識サービスに依存せず、プライベートで低遅延なシステム全体の音声入力の代替手段を提供します。

動作方法

このツールは、設定されたホットキー(プッシュ・トゥ・トークまたはトグル)を待機するバックグラウンドデーモンとして動作します。ホットキーが押されると音声を録音し、解放された時点で複数のローカルAIエンジンのいずれかを使って音声を音声認識します。その後、テキストをアクティブなウィンドウにシミュレート入力します。Linuxデスクトップ環境(WaylandおよびX11)と深く統合されており、MPRIS経由でメディアプレーヤーを自動的に一時停止できます。

対象ユーザー

クラウドサブスクリプションやテレメトリに依存せずに、高速でプライベート、かつ高度にカスタマイズ可能な音声入力体験を求める Linux ユーザー。

特徴

  • 複数のAIエンジン: Whisper、Parakeet、Moonshine、SenseVoice、Paraformer、Dolphin、Omnilingual をサポート。1600語以上をカバー。
  • 高パフォーマンス: CPUおよびGPU(Vulkan、CUDA、Metal、ROCm)加速に対応。最新CPUでは最大11倍リアルタイム速度を達成。
  • ローカル最優先: クラウドもサブスクリプションもテレメトリも不要。音声は機械上に留まる。
  • 高度なテキスト処理: 組み込みの単語置換、発話された句読点の変換、外部LLMを介して文法修正を行うためのパイプ処理機能を備える。
  • ミーティングモード: スピーカー識別付きの継続的音声認識を提供し、Markdown、JSON、SRTなどの形式でエクスポート可能。
  • ネイティブLinux統合: Hyprland、Sway、GNOME、KDE などのさまざまなコンポジターに対応。視覚フィードバック用の浮動波形OSDを備える。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト