kstonekuan/tambourine-voice
Your personal voice interface for any app. Speak naturally and your words appear wherever your cursor is, with fully customizable AI voice dictation. Open source alternative to Wispr Flow.
何を解決するか
Tambourine は、ユーザーがコンピュータ上の任意のアプリケーションに音声でテキストを入力できる、ユニバーサルな音声認識インターフェースを提供します。ネイティブな音声入力ツールの制限を克服し、高度なカスタマイズ性、不要な語句の削除機能、さまざまなAIプロバイダーによる音声認識とフォーマット処理の柔軟性を提供します。
動作方法
このシステムは、TauriベースのデスクトップアプリとPythonサーバーから構成されています。ユーザーがホットキーをトリガーすると、アプリは音声をキャプチャし、WebRTC経由でサーバーにストリーミングします。サーバーは音声認識(STT)プロバイダーを使用して音声をテキストに変換し、その後、大規模言語モデル(LLM)を介して不要な語句の削除、句読点の追加、カスタムフォーマットルールの適用など、テキストの整形を行います。最終的に完成したテキストは、カーソル位置に自動的にアクティブなアプリケーションにタイプインされます。
対象ユーザー
タイプよりも速くアイデアを記録したいユーザー、プロフェッショナルや技術的なワークフローに高度にカスタマイズ可能な音声インターフェースが必要なユーザー、およびプロプライエタリな音声入力ソフトウェアのオープンソース代替を好むユーザーに最適です。
主な特徴
- ユニバーサル互換性: メール、メッセージ、ドキュメント、コードエディタ、ターミナルなど、あらゆるアプリケーションで動作します。
- 柔軟なAIバックエンド: Deepgram、Groq、OpenAIなどのSTTプロバイダー、Anthropic、Gemini、CerebrasなどのLLMプロバイダーを幅広くサポートしており、WhisperやOllamaを介して完全にローカルで動作するオプションも利用可能です。
- 文脈に応じたフォーマット: 開いているアプリケーションを自動検出することで、出力スタイルをカスタマイズ(例:メールではフォーマル、メッセージではカジュアル)。
- カスタマイズ可能なコントロール: ユーザーが独自のフォーマットプロンプトを定義でき、技術用語用の個人用辞書を維持できます。
- 二段階記録モード: グローバルホットキーで「押しっぱなし記録」モードと「トグル」モードの両方を提供。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト