cjpais/Handy

A free, open source, and extensible speech-to-text application that works completely offline.

解決する課題

Handy はプライバシー重視のオープンソース音声認識アプリケーションで、ユーザーが話した言葉をコンピュータ上の任意のアクティブテキストフィールドに直接文字起こしできます。クラウドベースの文字起こしサービスを必要とせず、音声データがローカルに留まりプライベートであることを保証します。

仕組み

ユーザーは設定可能なキーボードショートカットまたはプッシュ・トゥ・トークモードで文字起こしを開始します。アプリは Silero の Voice Activity Detection(VAD)で無音を除去し、ローカルの機械学習モデルで音声を処理します。Whisper の各種サイズモデル(GPU 加速対応)や、CPU 最適化された Parakeet V3 モデル(自動言語検出)など、複数のモデルオプションをサポートします。

対象ユーザー

Windows、macOS、Linux で完全オフラインで動作し、無料でプライベートかつ拡張可能な音声認識ツールを求めるユーザー向けに設計されています。

ハイライト

  • 完全ローカル:すべての処理はユーザーのマシン上で行われ、クラウドへのデータ送信はありません。
  • クロスプラットフォーム:Windows、macOS、Linux をネイティブにサポート。
  • 柔軟なモデルサポート:Whisper(Small、Medium、Turbo、Large)と Parakeet V3 モデルに対応。
  • 拡張性:Tauri アプリケーション(Rust バックエンド、React フロントエンド)として構築され、フォークしやすい設計。
  • システム統合:macOS では Raycast と統合し、リモート制御用の CLI フラグもサポート。