cjpais/Handy
A free, open source, and extensible speech-to-text application that works completely offline.
解決する課題
Handy はプライバシー重視のオープンソース音声認識アプリケーションで、ユーザーが話した言葉をコンピュータ上の任意のアクティブテキストフィールドに直接文字起こしできます。クラウドベースの文字起こしサービスを必要とせず、音声データがローカルに留まりプライベートであることを保証します。
仕組み
ユーザーは設定可能なキーボードショートカットまたはプッシュ・トゥ・トークモードで文字起こしを開始します。アプリは Silero の Voice Activity Detection(VAD)で無音を除去し、ローカルの機械学習モデルで音声を処理します。Whisper の各種サイズモデル(GPU 加速対応)や、CPU 最適化された Parakeet V3 モデル(自動言語検出)など、複数のモデルオプションをサポートします。
対象ユーザー
Windows、macOS、Linux で完全オフラインで動作し、無料でプライベートかつ拡張可能な音声認識ツールを求めるユーザー向けに設計されています。
ハイライト
- 完全ローカル:すべての処理はユーザーのマシン上で行われ、クラウドへのデータ送信はありません。
- クロスプラットフォーム:Windows、macOS、Linux をネイティブにサポート。
- 柔軟なモデルサポート:Whisper(Small、Medium、Turbo、Large)と Parakeet V3 モデルに対応。
- 拡張性:Tauri アプリケーション(Rust バックエンド、React フロントエンド)として構築され、フォークしやすい設計。
- システム統合:macOS では Raycast と統合し、リモート制御用の CLI フラグもサポート。