kstonekuan/tambourine-voice

Your personal voice interface for any app. Speak naturally and your words appear wherever your cursor is, with fully customizable AI voice dictation. Open source alternative to Wispr Flow.

解決的問題

Tambourine 提供一個通用的語音轉文字介面,讓使用者能將語音輸入到電腦上的任何應用程式中。它克服了原生語音輸入工具的限制,提供高度個人化、可移除填充詞、並支援使用多種 AI 提供商進行語音辨識與格式化處理的彈性。

工作原理

此系統由基於 Tauri 的桌面應用程式和 Python 伺服器組成。當使用者觸發快捷鍵時,應用程式會捕獲音訊,並透過 WebRTC 將其串流至伺服器。伺服器使用語音轉文字(STT)提供者將音訊轉錄為文字,然後透過大型語言模型(LLM)清理填充詞、添加標點符號並套用自訂格式規則。最終潤飾後的文字會自動在目前活躍的應用程式中光標位置輸入。

適用對象

適用於希望比打字更快記錄想法的使用者,需要高度可客製化語音介面以應對專業或技術工作流程的使用者,以及偏好開源替代品而非專有語音輸入軟體的使用者。

主要亮點

  • 通用相容性:適用於郵件、訊息、文件、程式碼編輯器和終端機等各類應用程式。
  • 彈性 AI 後端:支援多種 STT(如 Deepgram、Groq、OpenAI)和 LLM(如 Anthropic、Gemini、Cerebras)提供者,包括透過 Whisper 和 Ollama 實現的完全本機化選項。
  • 上下文感知格式化:自動偵測目前聚焦的應用程式,以調整輸出風格(例如,郵件使用正式風格,訊息使用隨意風格)。
  • 可自訂控制:使用者可定義自己的格式化提示,並維護個人技術術語詞典。
  • 雙模式錄音:透過全域快捷鍵提供「按住錄音」和「切換」兩種模式。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案