VocaHQ/vocalinux

Free, open-source, 100% offline voice dictation for Linux. Speak and type anywhere via whisper.cpp, Whisper & VOSK engines, GPU-accelerated, works on X11 + Wayland!

何を解決するか

Vocalinuxは、Linuxユーザー向けにシームレスでプライバシー重視の音声認識テキスト変換体験を提供します。X11またはWaylandを使用しているかどうかに関係なく、任意のアプリケーションに音声でテキストを入力できるため、ネイティブLinuxの音声入力機能に欠けていた部分を埋めます。

動作方法

このアプリはデスクトップアプリとして実行され、音声をキャプチャし、3つのオンデバイス音声認識エンジンのいずれかを使ってテキストに変換します:whisper.cpp(デフォルト)、OpenAI Whisper、またはVOSK。GPU加速にはVulkanを使用し、AMD、Intel、NVIDIAのハードウェアすべてで互換性があります。モデルをダウンロードした後は、すべての処理がユーザーのマシン上でローカルに実行されます。変換されたテキストはIBusやその他のインジェクション方法を通じて、アクティブなアプリケーションに挿入されます。

対象ユーザー

Ubuntu、Debian、Fedora、Archなど、さまざまなディストリビューションで動作する高品質でプライバシー保護された、システム全体で使える音声入力ツールを求めるLinuxデスクトップユーザー。

特徴

  • オンデバイス処理:初期のモデルダウンロード後は、音声認識からテキスト変換まですべてローカルで行われ、最大限のプライバシーを確保します。
  • エンジンの柔軟な選択:高性能を求めるユーザー向けにwhisper.cpp、PyTorchユーザー向けにOpenAI Whisper、低RAM環境向けにVOSKをサポートします。
  • ユニバーサルLinux対応:主要ディストリビューションでX11およびWaylandの両方に対応しています。
  • カスタマイズ可能な起動方法:トグルモードとプッシュツータルクモードを提供し、キーボードショートカットをカスタマイズ可能。
  • GPU加速:Vulkanを活用し、広範なハードウェア互換性を実現。
  • ニューラルVAD:Silero Voice Activity Detectionを内蔵し、録音の正確性を向上させます。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト